{"as_of":"2026-08-16T02:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a6c251ccfe51fa3907564dc2bdfef08a06c7286996d4237dec04b1e3ba77cf6f","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T21:18:29.153977Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T15:13:50.935010Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09101","snapshot_observed_at":"2026-08-04T08:03:36.759783Z","title":"Autocodebench: Large language models are automatic code benchmark generators,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.23008","last_updated":"2026-05-25T08:27:58Z","snapshot_observed_at":"2026-08-04T08:03:34.697567Z","submitted_at":"2025-10-27T04:57:20Z","title":"From Prompt Optimization to Multi-Dimensional Credibility Evaluation: Enhancing Trustworthiness of Chinese LLM-Generated Liver MRI Reports -- with Preliminary Extension to Lung Cancer","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T08:03:36.759783Z"},"links":{"cited_paper":"/paper/2508.09101","citing_paper":"/paper/2510.23008"},"observation_digest":"sha256:d84b728c9d10ecaa138bf1c36ad81079e42a217eaafdadbf8834a03512df3c22","observation_id":"7371962a-864c-4fe9-b8c9-13480715b815","resolution":{"observed_at":"2026-08-04T08:03:36.759783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"cited_work":{"arxiv_id":"2508.09101","doi":"10.48550/arxiv.2508.09101","metadata_source":"pith","pith_arxiv_id":"2508.09101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Koen Claessen and John Hughes","venue":"cs.CL","work_id":"d89726ee-893f-4853-8207-bbed25feabc1","year":2025},"citing_paper":{"arxiv_id":"2604.17308","last_updated":"2026-04-19T07:51:46Z","snapshot_observed_at":"2026-08-12T16:33:08.248134Z","submitted_at":"2026-04-19T07:51:46Z","title":"SkillFlow:Benchmarking Lifelong Skill Discovery and Evolution for Autonomous Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T06:13:32.434201Z"},"links":{"cited_paper":"/paper/2508.09101","citing_paper":"/paper/2604.17308"},"observation_digest":"sha256:6af2bc1e36b92205900e459bff5f79b355550204bb9d9bcaf015c89ce1a9b55d","observation_id":"4c58ae96-276a-4872-823c-8b0dc95a06ac","resolution":{"observed_at":"2026-05-10T06:21:27.166102Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"cited_work":{"arxiv_id":"2508.09101","doi":"10.48550/arxiv.2508.09101","metadata_source":"pith","pith_arxiv_id":"2508.09101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Koen Claessen and John Hughes","venue":"cs.CL","work_id":"d89726ee-893f-4853-8207-bbed25feabc1","year":2025},"citing_paper":{"arxiv_id":"2605.10865","last_updated":"2026-05-12T05:46:14Z","snapshot_observed_at":"2026-08-14T06:02:29.587212Z","submitted_at":"2026-05-11T17:13:36Z","title":"BenchCAD: A Comprehensive, Industry-Standard Benchmark for Programmatic CAD","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-12T03:50:08.540154Z"},"links":{"cited_paper":"/paper/2508.09101","citing_paper":"/paper/2605.10865"},"observation_digest":"sha256:ef6ca2fac86276255318eb4d175c3f378f653cf99a2de33c9fb98c9d73f3518c","observation_id":"047e65da-4768-4396-9fd1-9824a011065d","resolution":{"observed_at":"2026-05-12T06:56:26.856757Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"cited_work":{"arxiv_id":"2508.09101","doi":"10.48550/arxiv.2508.09101","metadata_source":"pith","pith_arxiv_id":"2508.09101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Koen Claessen and John Hughes","venue":"cs.CL","work_id":"d89726ee-893f-4853-8207-bbed25feabc1","year":2025},"citing_paper":{"arxiv_id":"2605.10865","last_updated":"2026-05-12T05:46:14Z","snapshot_observed_at":"2026-08-14T06:02:29.587212Z","submitted_at":"2026-05-11T17:13:36Z","title":"BenchCAD: A Comprehensive, Industry-Standard Benchmark for Programmatic CAD","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-13T02:57:54.534780Z"},"links":{"cited_paper":"/paper/2508.09101","citing_paper":"/paper/2605.10865"},"observation_digest":"sha256:e11ce0af1bf559b8d6c9301e92fe455d3a139c578c5b09e45a3625020c5a2de2","observation_id":"73863823-1d47-4baa-98a7-64b200170ad5","resolution":{"observed_at":"2026-05-13T03:02:10.397601Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"cited_work":{"arxiv_id":"2508.09101","doi":"10.48550/arxiv.2508.09101","metadata_source":"pith","pith_arxiv_id":"2508.09101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Koen Claessen and John Hughes","venue":"cs.CL","work_id":"d89726ee-893f-4853-8207-bbed25feabc1","year":2025},"citing_paper":{"arxiv_id":"2605.15222","last_updated":"2026-05-13T08:10:26Z","snapshot_observed_at":"2026-07-06T23:26:32.979566Z","submitted_at":"2026-05-13T08:10:26Z","title":"PerfCodeBench: Benchmarking LLMs for System-Level High-Performance Code Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T18:03:07.156185Z"},"links":{"cited_paper":"/paper/2508.09101","citing_paper":"/paper/2605.15222"},"observation_digest":"sha256:bc85d96148cd1f6ac28e09cc9e8b1682bb4854bde56f8850eb939863af1da169","observation_id":"b6d6a3cd-23bd-4de5-b7da-61bbe650cd73","resolution":{"observed_at":"2026-05-19T18:03:10.102773Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"cited_work":{"arxiv_id":"2508.09101","doi":"10.48550/arxiv.2508.09101","metadata_source":"pith","pith_arxiv_id":"2508.09101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Koen Claessen and John Hughes","venue":"cs.CL","work_id":"d89726ee-893f-4853-8207-bbed25feabc1","year":2025},"citing_paper":{"arxiv_id":"2605.15229","last_updated":"2026-05-30T04:31:25Z","snapshot_observed_at":"2026-08-13T20:59:40.702704Z","submitted_at":"2026-05-13T18:01:05Z","title":"PBT-Bench: Benchmarking AI Agents on Property-Based Testing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-19T17:25:00.033951Z"},"links":{"cited_paper":"/paper/2508.09101","citing_paper":"/paper/2605.15229"},"observation_digest":"sha256:95204c68c286da722ee9d72fb4bab46a2f5ab094e8753dc040a7291b984e2ba6","observation_id":"20d73053-a8b1-4e43-9d1c-3281bf908ec5","resolution":{"observed_at":"2026-05-19T17:27:41.334004Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"cited_work":{"arxiv_id":"2508.09101","doi":"10.48550/arxiv.2508.09101","metadata_source":"pith","pith_arxiv_id":"2508.09101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Koen Claessen and John Hughes","venue":"cs.CL","work_id":"d89726ee-893f-4853-8207-bbed25feabc1","year":2025},"citing_paper":{"arxiv_id":"2605.15229","last_updated":"2026-05-30T04:31:25Z","snapshot_observed_at":"2026-08-13T20:59:40.702704Z","submitted_at":"2026-05-13T18:01:05Z","title":"PBT-Bench: Benchmarking AI Agents on Property-Based Testing","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T07:58:17.923151Z"},"links":{"cited_paper":"/paper/2508.09101","citing_paper":"/paper/2605.15229"},"observation_digest":"sha256:aa7f97f27ea6757084d2d150cbbd6346f54963168117cef08ef60448bbeb32a9","observation_id":"6ce5e85f-b918-4633-a49a-516fb707b71b","resolution":{"observed_at":"2026-05-21T07:59:50.106865Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"cited_work":{"arxiv_id":"2508.09101","doi":"10.48550/arxiv.2508.09101","metadata_source":"pith","pith_arxiv_id":"2508.09101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Koen Claessen and John Hughes","venue":"cs.CL","work_id":"d89726ee-893f-4853-8207-bbed25feabc1","year":2025},"citing_paper":{"arxiv_id":"2605.15229","last_updated":"2026-05-30T04:31:25Z","snapshot_observed_at":"2026-08-13T20:59:40.702704Z","submitted_at":"2026-05-13T18:01:05Z","title":"PBT-Bench: Benchmarking AI Agents on Property-Based Testing","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T21:18:55.451558Z"},"links":{"cited_paper":"/paper/2508.09101","citing_paper":"/paper/2605.15229"},"observation_digest":"sha256:524631f771f45c4d9f9792b5ca3c4d717a0a6f9c32af975b7a739d824cd44d4f","observation_id":"497e3519-f1de-4a52-9bd7-b0c5b14b951f","resolution":{"observed_at":"2026-07-01T14:25:47.101402Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"cited_work":{"arxiv_id":"2508.09101","doi":"10.48550/arxiv.2508.09101","metadata_source":"pith","pith_arxiv_id":"2508.09101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Koen Claessen and John Hughes","venue":"cs.CL","work_id":"d89726ee-893f-4853-8207-bbed25feabc1","year":2025},"citing_paper":{"arxiv_id":"2605.29277","last_updated":"2026-05-28T02:52:58Z","snapshot_observed_at":"2026-08-12T13:42:11.162623Z","submitted_at":"2026-05-28T02:52:58Z","title":"Code-QA-Bench: Separating Code Reasoning from Documentation Memorization in Repository-Level QA","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T07:00:07.102425Z"},"links":{"cited_paper":"/paper/2508.09101","citing_paper":"/paper/2605.29277"},"observation_digest":"sha256:fef0b48812453bd9a68998c6c7aa70a8ca43c9c74a4dc1a2193f5ba86a9ed8cc","observation_id":"8bed6de6-6e17-4131-9582-0a657bbfb095","resolution":{"observed_at":"2026-06-29T07:03:12.926179Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"cited_work":{"arxiv_id":"2508.09101","doi":"10.48550/arxiv.2508.09101","metadata_source":"pith","pith_arxiv_id":"2508.09101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Koen Claessen and John Hughes","venue":"cs.CL","work_id":"d89726ee-893f-4853-8207-bbed25feabc1","year":2025},"citing_paper":{"arxiv_id":"2607.07744","last_updated":"2026-07-08T08:32:18Z","snapshot_observed_at":"2026-08-14T02:14:15.780925Z","submitted_at":"2026-07-08T08:32:18Z","title":"PERFOPT-Bench: Evaluating Coding Agents on Software Performance Optimization","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-10T19:53:34.169337Z"},"links":{"cited_paper":"/paper/2508.09101","citing_paper":"/paper/2607.07744"},"observation_digest":"sha256:fe8a0613b8fb125e261383860a2297977a6b67075532841c8c5915ee7cb9e839","observation_id":"3bdce69e-548b-480a-8975-a62cb8b0a0b5","resolution":{"observed_at":"2026-07-10T19:57:33.806970Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09101","snapshot_observed_at":"2026-08-04T15:13:50.935010Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02101","last_updated":"2026-08-03T12:01:18Z","snapshot_observed_at":"2026-08-07T22:10:34.249752Z","submitted_at":"2026-08-03T12:01:18Z","title":"Cross-Domain Hybrid OPD for Generalizable Search Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T15:13:50.935010Z"},"links":{"cited_paper":"/paper/2508.09101","citing_paper":"/paper/2608.02101"},"observation_digest":"sha256:db68da5d3f098f7cdd1f759abc4615e6ede87c3af5cdf6b97a575ab3f7496cc1","observation_id":"452afdc8-54b1-40b5-894c-937eddea0652","resolution":{"observed_at":"2026-08-04T15:13:50.935010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.09101/citation-record","integrity":"/paper/2508.09101/integrity","json":"/paper/2508.09101/citation-record.json","paper":"/paper/2508.09101"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.02737","last_updated":"2025-02-04T21:43:16Z","snapshot_observed_at":"2026-08-14T05:03:05.661970Z","submitted_at":"2025-02-04T21:43:16Z","title":"SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02737","snapshot_observed_at":"2026-08-05T21:18:26.079582Z","title":"Anthropic","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:26.079582Z"},"links":{"cited_paper":"/paper/2502.02737","citing_paper":"/paper/2508.09101"},"observation_digest":"sha256:e9df0ec5b54599ea5dadae930c404f8eb615cbad14bfd8265f12da4b4dd85a27","observation_id":"404202ab-2ac9-4e89-8da3-dda9575e996a","resolution":{"observed_at":"2026-08-05T21:18:26.079582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T21:18:26.382315Z","title":"Wei-Lin Chen, Zhepei Wei, Xinyu Zhu, Shi Feng, and Yu Meng","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:26.382315Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2508.09101"},"observation_digest":"sha256:1a460419ba07c9fe74f278e2fb5cbb99fabad6c473506b447fec6a6b944f69b1","observation_id":"9f4636e5-23dd-41ba-983f-f6bc70d50431","resolution":{"observed_at":"2026-08-05T21:18:26.382315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-05T21:18:26.487023Z","title":"DeepSeek-AI","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:26.487023Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2508.09101"},"observation_digest":"sha256:37bffb9f8c54f7668fc56419f2f724db6786712a3d1ffe05455accdc0c832665","observation_id":"88c0a9ab-50c2-47c8-baa9-c206e77a5ff7","resolution":{"observed_at":"2026-08-05T21:18:26.487023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-05T21:18:26.684754Z","title":"Daya Guo, Qihao Zhu, Dejian Yang, Zhenda Xie, Kai Dong, Wentao Zhang, Guanting Chen, Xiao Bi, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:26.684754Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2508.09101"},"observation_digest":"sha256:e48714884fddecb697c7739ba783db9ace266088ed84077089696b4187c532c1","observation_id":"bc1b5865-60ff-4b34-ace1-859c6c1ec486","resolution":{"observed_at":"2026-08-05T21:18:26.684754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14196","last_updated":"2024-01-26T09:23:11Z","snapshot_observed_at":"2026-08-06T22:40:28.707813Z","submitted_at":"2024-01-25T14:17:53Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14196","snapshot_observed_at":"2026-08-05T21:18:26.806206Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:26.806206Z"},"links":{"cited_paper":"/paper/2401.14196","citing_paper":"/paper/2508.09101"},"observation_digest":"sha256:104be4f52b1058dc170c41dc2037630835ef1213a2833803317be1a62af58b46","observation_id":"5e425ee9-5964-4615-9b3b-667575a21e79","resolution":{"observed_at":"2026-08-05T21:18:26.806206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03543","last_updated":"2025-04-08T09:39:25Z","snapshot_observed_at":"2026-08-13T00:37:37.510850Z","submitted_at":"2024-04-04T15:49:49Z","title":"CodeEditorBench: Evaluating Code Editing Capability of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03543","snapshot_observed_at":"2026-08-05T21:18:26.902628Z","title":"Dan Hendrycks, Steven Basart, Saurav Kadavath, Mantas Mazeika, Akul Arora, Ethan Guo, Collin Burns, Samir Puranik, Horace He, Dawn Song, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:26.902628Z"},"links":{"cited_paper":"/paper/2404.03543","citing_paper":"/paper/2508.09101"},"observation_digest":"sha256:b4b746eaa71bc509b58c735a4f9d1efcd5fa11e6d6ba3f5f8e8fced007e505f7","observation_id":"fa5a5a28-0ac1-4775-851b-8c5c793c757c","resolution":{"observed_at":"2026-08-05T21:18:26.902628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04905","last_updated":"2025-03-20T03:28:56Z","snapshot_observed_at":"2026-08-12T22:05:29.529733Z","submitted_at":"2024-11-07T17:47:25Z","title":"OpenCoder: The Open Cookbook for Top-Tier Code Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04905","snapshot_observed_at":"2026-08-05T21:18:27.044990Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:27.044990Z"},"links":{"cited_paper":"/paper/2411.04905","citing_paper":"/paper/2508.09101"},"observation_digest":"sha256:c0731b9828913a585a699700f6460007fb1178700e2a7fdf911eafa818134a73","observation_id":"00d38d5b-e319-42f8-aae5-5374c6abcd54","resolution":{"observed_at":"2026-08-05T21:18:27.044990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00515","last_updated":"2024-11-10T22:02:27Z","snapshot_observed_at":"2026-08-14T16:40:35.729198Z","submitted_at":"2024-06-01T17:48:15Z","title":"A Survey on Large Language Models for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00515","snapshot_observed_at":"2026-08-05T21:18:27.251061Z","title":"Carlos E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:27.251061Z"},"links":{"cited_paper":"/paper/2406.00515","citing_paper":"/paper/2508.09101"},"observation_digest":"sha256:a97d04f164b3b26f1c94b68fdcc3e20fc735c0d1d17f8cb3fe9b5c67127cf98b","observation_id":"6975957d-e735-491d-823a-f8a3aa8a3483","resolution":{"observed_at":"2026-08-05T21:18:27.251061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-08-12T14:56:35.025839Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-05T21:18:27.367469Z","title":"Kimi-Team","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:27.367469Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2508.09101"},"observation_digest":"sha256:79ef548e4cc18b9ead2b75ef99d627797bd365116a205a5a362d938b99d80ea1","observation_id":"67f9ac42-4e66-4c4a-9d08-e37b918d8067","resolution":{"observed_at":"2026-08-05T21:18:27.367469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-08-05T21:18:27.496436Z","title":"Woosuk Kwon, Zhuohan Li, Siyuan Zhuang, Ying Sheng, Lianmin Zheng, Cody Hao Yu, Joseph E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:27.496436Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2508.09101"},"observation_digest":"sha256:ea0089a8ce3b47c571080772af20c42fcc7bf51bb1471ff85a93a57d535f1495","observation_id":"374da8da-6e88-42f5-a76b-56d2633b4d27","resolution":{"observed_at":"2026-08-05T21:18:27.496436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:18:27.605502Z","title":"doi: 10.1126/science.abq1158","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:27.605502Z"},"links":{"citing_paper":"/paper/2508.09101"},"observation_digest":"sha256:6f62c22fab193b569b2405fccc52354d4157c76d2115c7fcef439c0ddd3e2b71","observation_id":"286b0d4e-c561-4888-9959-9117a668303d","resolution":{"observed_at":"2026-08-05T21:18:27.605502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16694","last_updated":"2024-03-24T15:41:21Z","snapshot_observed_at":"2026-08-13T22:46:34.001827Z","submitted_at":"2024-02-26T16:09:00Z","title":"HumanEval-XL: A Multilingual Code Generation Benchmark for Cross-lingual Natural Language Generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16694","snapshot_observed_at":"2026-08-05T21:18:27.684747Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:27.684747Z"},"links":{"cited_paper":"/paper/2402.16694","citing_paper":"/paper/2508.09101"},"observation_digest":"sha256:14695452955ffa45f960a1586ae776b3942011ab39c1651457c1d2df47af0d71","observation_id":"a6400a4c-50e6-481e-bee3-ff5cc6e04de4","resolution":{"observed_at":"2026-08-05T21:18:27.684747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-15T21:08:10.475006Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-05T21:18:27.805253Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:27.805253Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2508.09101"},"observation_digest":"sha256:438c31715b7cfe2bf7904fb8353be07e325ed167b8c16ad40a1a8478bae1eefd","observation_id":"17e42d19-1e94-48f3-aa19-8c9786923d78","resolution":{"observed_at":"2026-08-05T21:18:27.805253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T21:18:27.886461Z","title":"Baptiste Roziere, Jonas Gehring, Fabian Gloeckle, Sten Sootla, Itai Gat, Xiaoqing Ellen Tan, Yossi Adi, Jingyu Liu, Romain Sauvestre, Tal Remez, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:27.886461Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2508.09101"},"observation_digest":"sha256:c05198426adc451e0c78f479f9dccb5bab86eceddca45aec461b212aa001c761","observation_id":"89d7ccf0-3ccd-4544-97a7-104087f96718","resolution":{"observed_at":"2026-08-05T21:18:27.886461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03524","last_updated":"2025-06-05T03:26:05Z","snapshot_observed_at":"2026-08-13T13:37:23.026438Z","submitted_at":"2025-06-04T03:17:19Z","title":"Seed-Coder: Let the Code Model Curate Data for Itself","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03524","snapshot_observed_at":"2026-08-05T21:18:27.964338Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:27.964338Z"},"links":{"cited_paper":"/paper/2506.03524","citing_paper":"/paper/2508.09101"},"observation_digest":"sha256:3d6a99deee0c2ecb0619c40e75843c60ef29b0417f9a72cb10e5f38ca9bc1590","observation_id":"f91e24b2-3419-459c-81de-f8f935449a3f","resolution":{"observed_at":"2026-08-05T21:18:27.964338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:18:28.059166Z","title":"Kaixin Wang, Tianlin Li, Xiaoyu Zhang, Chong Wang, Weisong Sun, Yang Liu, and Bin Shi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:28.059166Z"},"links":{"citing_paper":"/paper/2508.09101"},"observation_digest":"sha256:0081067ac54b925f9505e3affa58e356947cc3683507a147c3b0609e32b79be7","observation_id":"198c1050-280b-453d-ac36-ed6b2c83b42c","resolution":{"observed_at":"2026-08-05T21:18:28.059166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14187","last_updated":"2024-06-07T07:46:28Z","snapshot_observed_at":"2026-08-13T04:57:52.395132Z","submitted_at":"2023-12-20T09:02:29Z","title":"WaveCoder: Widespread And Versatile Enhancement For Code Large Language Models By Instruction Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14187","snapshot_observed_at":"2026-08-05T21:18:28.245399Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:28.245399Z"},"links":{"cited_paper":"/paper/2312.14187","citing_paper":"/paper/2508.09101"},"observation_digest":"sha256:ac7357de41e15916bfe719c44e94eb6c86e2db1dd0211e9266d53fe8193d8f3e","observation_id":"8f29a7ea-cecd-4d38-b937-1b72fb680195","resolution":{"observed_at":"2026-08-05T21:18:28.245399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02605","last_updated":"2025-04-03T14:06:17Z","snapshot_observed_at":"2026-08-09T23:51:45.534260Z","submitted_at":"2025-04-03T14:06:17Z","title":"Multi-SWE-bench: A Multilingual Benchmark for Issue Resolving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02605","snapshot_observed_at":"2026-08-05T21:18:28.374667Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:28.374667Z"},"links":{"cited_paper":"/paper/2504.02605","citing_paper":"/paper/2508.09101"},"observation_digest":"sha256:6a73b9276460529097ff2ee49d58eb412a6dc7b248acf0f94ae269ea5f8b0f5c","observation_id":"95dcbbed-88af-4ba4-8607-d4235f3ba155","resolution":{"observed_at":"2026-08-05T21:18:28.374667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04520","last_updated":"2024-05-07T17:52:51Z","snapshot_observed_at":"2026-08-13T00:12:52.578504Z","submitted_at":"2024-05-07T17:52:51Z","title":"NaturalCodeBench: Examining Coding Performance Mismatch on HumanEval and Natural User Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04520","snapshot_observed_at":"2026-08-05T21:18:28.467608Z","title":"Tianyu Zheng, Ge Zhang, Tianhao Shen, Xueling Liu, Bill Yuchen Lin, Jie Fu, Wenhu Chen, and Xiang Yue","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:28.467608Z"},"links":{"cited_paper":"/paper/2405.04520","citing_paper":"/paper/2508.09101"},"observation_digest":"sha256:12a06b28e73d7b3a49fc4264601d4949d2349f13e9650bc721f639e0c2c000d2","observation_id":"71b73a86-1486-4778-a990-b970b84c1c16","resolution":{"observed_at":"2026-08-05T21:18:28.467608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:18:28.544826Z","title":"doi: 10.18653/v1/2024.findings-acl.762","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:28.544826Z"},"links":{"citing_paper":"/paper/2508.09101"},"observation_digest":"sha256:0f407fcd2bb8a180d9c4ec6cbc5aa1d40bb11bf45428a210912e8e381e34bf61","observation_id":"dd3f18c5-5e10-43a6-ad1f-60500951a413","resolution":{"observed_at":"2026-08-05T21:18:28.544826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11928","last_updated":"2025-06-13T16:29:09Z","snapshot_observed_at":"2026-08-15T21:08:08.319825Z","submitted_at":"2025-06-13T16:29:09Z","title":"LiveCodeBench Pro: How Do Olympiad Medalists Judge LLMs in Competitive Programming?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11928","snapshot_observed_at":"2026-08-05T21:18:28.722411Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:28.722411Z"},"links":{"cited_paper":"/paper/2506.11928","citing_paper":"/paper/2508.09101"},"observation_digest":"sha256:c26a67d97bafb209f01bff9f3c5a892f8fb5508a6829266239fda8a7fd826ea1","observation_id":"b367fcbe-3f42-4b12-972c-c2789e8c36da","resolution":{"observed_at":"2026-08-05T21:18:28.722411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09183","last_updated":"2025-08-21T16:39:55Z","snapshot_observed_at":"2026-08-13T23:31:22.966504Z","submitted_at":"2025-02-13T11:17:53Z","title":"RefineCoder: Iterative Improving of Large Language Models via Adaptive Critique Refinement for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09183","snapshot_observed_at":"2026-08-05T21:18:28.851648Z","title":"Qihao Zhu, Daya Guo, Zhihong Shao, Dejian Yang, Peiyi Wang, Runxin Xu, Y Wu, Yukun Li, Huazuo Gao, Shirong Ma, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:28.851648Z"},"links":{"cited_paper":"/paper/2502.09183","citing_paper":"/paper/2508.09101"},"observation_digest":"sha256:b01871f3930e4e869f56c149057770c56de505a31efb1241054714314ba93244","observation_id":"3d73353c-3220-4953-9140-324f45194dad","resolution":{"observed_at":"2026-08-05T21:18:28.851648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"cited_work":{"arxiv_id":"2506.10481","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.10481","snapshot_observed_at":"2026-08-05T21:18:29.388938Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","venue":"cs.AI","work_id":"0feea441-1a9a-4ea0-9fe0-4487a48b73e0","year":2025},"citing_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:28.946759Z"},"links":{"cited_paper":"/paper/2506.10481","citing_paper":"/paper/2508.09101"},"observation_digest":"sha256:dcb1f65b83ad1f63290181d566dca1aee2cad09dea30a8bdceef36f13d26f04f","observation_id":"13979a02-a595-4766-af05-c8b0caeed694","resolution":{"observed_at":"2026-08-05T21:18:29.439278Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:18:45.199404Z","title":"__main__","venue":null,"work_id":"4061e54e-eea9-442d-a314-cdce0c31ccaa","year":2025},"citing_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:29.054637Z"},"links":{"citing_paper":"/paper/2508.09101"},"observation_digest":"sha256:6559d935a82853a427e72ef6202061bbe97ebe5df0541f6e5d932455c77bdf27","observation_id":"96c61cb4-bdfe-4e48-a81e-6586fbc8ad55","resolution":{"observed_at":"2026-08-05T21:18:45.388228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:18:44.970214Z","title":"22 # Code Benchmark Construction TaskIn order to build the code benchmark, I need you to help me create a Python function, as well as two test functions","venue":null,"work_id":"6d1cd89e-88c4-48d7-8f78-d355c332bb6e","year":2025},"citing_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:29.153977Z"},"links":{"citing_paper":"/paper/2508.09101"},"observation_digest":"sha256:41f9ff7862344d622f85b1647172a6700fce178ee3d43e1f92f90aab15239647","observation_id":"8eefd89b-f45a-4c78-80ed-437b17880e0f","resolution":{"observed_at":"2026-08-05T21:18:45.076736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-05T21:18:28.164750Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:28.164750Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2508.09101"},"observation_digest":"sha256:29ca401029c8556d1208746337afce9d89fa4debd219b9eaed0163ca35043f60","observation_id":"93d537fe-9023-497f-ac4f-9767c15470aa","resolution":{"observed_at":"2026-08-05T21:18:28.164750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-15T17:40:38.050939Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-05T21:18:26.165195Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:26.165195Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2508.09101"},"observation_digest":"sha256:250cf9de278f94b854676a5815c510ddc1a54697e6ad98667c95afefe12c5796","observation_id":"bcc817ce-4445-42ca-aa1a-d741bb9ca7ad","resolution":{"observed_at":"2026-08-05T21:18:26.165195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-08-05T21:18:26.294753Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:26.294753Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2508.09101"},"observation_digest":"sha256:58e2da6f007773dcade69b3d672c1241d3680abd559b48fdb7d3436e53c75b1b","observation_id":"97742432-eee2-45d9-8f71-b792fa671509","resolution":{"observed_at":"2026-08-05T21:18:26.294753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11931","last_updated":"2024-06-17T13:51:35Z","snapshot_observed_at":"2026-08-14T04:42:19.578053Z","submitted_at":"2024-06-17T13:51:35Z","title":"DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11931","snapshot_observed_at":"2026-08-05T21:18:26.575634Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:26.575634Z"},"links":{"cited_paper":"/paper/2406.11931","citing_paper":"/paper/2508.09101"},"observation_digest":"sha256:1c82be66f4d30e5a4ccd6d3c3c7a7d229634ec8aa4c750a5ed3ddc00ab3ac5dc","observation_id":"70e884f0-4d1e-45ba-8361-a00a8099eb0a","resolution":{"observed_at":"2026-08-05T21:18:26.575634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04030","last_updated":"2025-08-07T23:16:09Z","snapshot_observed_at":"2026-08-13T23:55:39.823902Z","submitted_at":"2025-04-05T02:52:16Z","title":"OpenCodeInstruct: A Large-scale Instruction Tuning Dataset for Code LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04030","snapshot_observed_at":"2026-08-05T21:18:25.994910Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:25.994910Z"},"links":{"cited_paper":"/paper/2504.04030","citing_paper":"/paper/2508.09101"},"observation_digest":"sha256:ed1ff065a480d863dd2d779ff0f5095d83a1a329c8efc186256c872b8964482b","observation_id":"5114ecfe-fb52-4e44-8466-be759840ff37","resolution":{"observed_at":"2026-08-05T21:18:25.994910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-14T05:02:28.959872Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 11 inbound Pith citation observations for arXiv:2508.09101."}