Pith. sign in

Paper Citation Record · LEDGER

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators

As of 19 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 11 inbound Pith citation observations for arXiv:2508.09101.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2508.09101 v1

Coverage vector

measured 30 of 30 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-05T21:18:29.153977Z

measured 41 of 41 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-18T06:34:40.430872+00:00

measured 11 of 11 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-04T15:13:50.935010Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-08-05T02:28:24.338817Z

Reference resolution

30 of 30 outbound references displayed

  • verified exact1
  • verified fuzzy2
  • unresolved27
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

0
pith, observed 2026-08-05T02:28:24.338817Z

Outbound references

Observation 404202ab-2ac9-4e89-8da3-dda9575e996a · outbound

This paper cites SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:26.079582Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:26.079582Z digest=sha256:da83e44227dc8cc90e2ddd814f8d6335ca3d255a70d98f3319bf723ae0c9d6f5

Observation 9f4636e5-23dd-41ba-983f-f6bc70d50431 · outbound

This paper cites Evaluating Large Language Models Trained on Code.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators Evaluating Large Language Models Trained on Code

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:26.382315Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:26.382315Z digest=sha256:3b5cf2c8471144bc8e3e2ee3fe87a6808747b892a1dae8c27db3280c768cf150

Observation 88c0a9ab-50c2-47c8-baa9-c206e77a5ff7 · outbound

This paper cites DeepSeek-V3 Technical Report.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators DeepSeek-V3 Technical Report

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:26.487023Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:26.487023Z digest=sha256:6a995f5a6d31a57c2b4b2a4b7def57675b4cd7d171d19a5f19846893fcda898d

Observation bc1b5865-60ff-4b34-ace1-859c6c1ec486 · outbound

This paper cites Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:26.684754Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:26.684754Z digest=sha256:807e4f048954b05b1cf449e7da95a8aad7339d21223e87ecd24de39cbb2ba9bb

Observation 5e425ee9-5964-4615-9b3b-667575a21e79 · outbound

This paper cites DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:26.806206Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:26.806206Z digest=sha256:ab4ad293573b281537a2fa49deb7e7301e5fc90d0b44bd444890786349bc50b5

Observation fa5a5a28-0ac1-4775-851b-8c5c793c757c · outbound

This paper cites CodeEditorBench: Evaluating Code Editing Capability of Large Language Models.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators CodeEditorBench: Evaluating Code Editing Capability of Large Language Models

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:26.902628Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:26.902628Z digest=sha256:557ae4af6ecd8ae724526ea161d42f18c2f7d8cfcdc08c73ef6aea7100219bf5

Observation 00d38d5b-e319-42f8-aae5-5374c6abcd54 · outbound

This paper cites OpenCoder: The Open Cookbook for Top-Tier Code Large Language Models.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators OpenCoder: The Open Cookbook for Top-Tier Code Large Language Models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:27.044990Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:27.044990Z digest=sha256:e68a9734cd21829a6eb7bf36b73689024b866af3ea495d029365b771219d626b

Observation 6975957d-e735-491d-823a-f8a3aa8a3483 · outbound

This paper cites A Survey on Large Language Models for Code Generation.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators A Survey on Large Language Models for Code Generation

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:27.251061Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:27.251061Z digest=sha256:2ac5a2d2c27531639da9600814175e1c058ca64ac60696a573bfd89af65d7799

Observation 67f9ac42-4e66-4c4a-9d08-e37b918d8067 · outbound

This paper cites SWE-bench: Can Language Models Resolve Real-World GitHub Issues?.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators SWE-bench: Can Language Models Resolve Real-World GitHub Issues?

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:27.367469Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:27.367469Z digest=sha256:adeb3986602ff967eef7c0966aae5ceb4f25a6cb0ff8d77b0488c29c0d388e39

Observation 374da8da-6e88-42f5-a76b-56d2633b4d27 · outbound

This paper cites Kimi K2: Open Agentic Intelligence.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators Kimi K2: Open Agentic Intelligence

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:27.496436Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:27.496436Z digest=sha256:a417ad2e3762f88b23137076e3de11b521c0e25d4b56d61a24e5b76187bd545a

Observation 286b0d4e-c561-4888-9959-9117a668303d · outbound

This paper cites doi: 10.1126/science.abq1158.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators doi: 10.1126/science.abq1158

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:27.605502Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:27.605502Z digest=sha256:f8978ddd445fd86505de2e56560a9c52435448141d184030f989db4f5edeef78

Observation a6400a4c-50e6-481e-bee3-ff5cc6e04de4 · outbound

This paper cites HumanEval-XL: A Multilingual Code Generation Benchmark for Cross-lingual Natural Language Generalization.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators HumanEval-XL: A Multilingual Code Generation Benchmark for Cross-lingual Natural Language Generalization

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:27.684747Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:27.684747Z digest=sha256:0fd6279eff459017feea71bcf5e9f2fac616b8dec7da87f0006875cc87f21468

Observation 17e42d19-1e94-48f3-aa19-8c9786923d78 · outbound

This paper cites CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:27.805253Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:27.805253Z digest=sha256:5b95aba83db292a53788c1799b3936a31973c971376cbe19d1069090422b2da1

Observation 89d7ccf0-3ccd-4544-97a7-104087f96718 · outbound

This paper cites Qwen2.5 Technical Report.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators Qwen2.5 Technical Report

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:27.886461Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:27.886461Z digest=sha256:222bb455068016e99389d5a3eae3fb34cdf3626ee38341ee34e6b9cc17cb662a

Observation f91e24b2-3419-459c-81de-f8f935449a3f · outbound

This paper cites Seed-Coder: Let the Code Model Curate Data for Itself.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators Seed-Coder: Let the Code Model Curate Data for Itself

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:27.964338Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:27.964338Z digest=sha256:8c170199cd353d9cd1ae22b88590463e2ce4b7c1255f31e6ff7b1f2bfe1da8cc

Observation 198c1050-280b-453d-ac36-ed6b2c83b42c · outbound

This paper cites Kaixin Wang, Tianlin Li, Xiaoyu Zhang, Chong Wang, Weisong Sun, Yang Liu, and Bin Shi.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators Kaixin Wang, Tianlin Li, Xiaoyu Zhang, Chong Wang, Weisong Sun, Yang Liu, and Bin Shi

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:28.059166Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:28.059166Z digest=sha256:068e23e9b5b2d069334561c44f6145bc9a9510f2767e503ac197f5ecf00d9283

Observation 8f29a7ea-cecd-4d38-b937-1b72fb680195 · outbound

This paper cites WaveCoder: Widespread And Versatile Enhancement For Code Large Language Models By Instruction Tuning.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators WaveCoder: Widespread And Versatile Enhancement For Code Large Language Models By Instruction Tuning

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:28.245399Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:28.245399Z digest=sha256:84413842f2cf4c3b9fabeb64c6e1945db26c2dc65f32e1e5d474e4957e1ae952

Observation 95dcbbed-88af-4ba4-8607-d4235f3ba155 · outbound

This paper cites Multi-SWE-bench: A Multilingual Benchmark for Issue Resolving.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators Multi-SWE-bench: A Multilingual Benchmark for Issue Resolving

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:28.374667Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:28.374667Z digest=sha256:b41e4c91019492bbeb4c8b36a9e6c088502804385c4110021d44609f00e097d4

Observation 71b73a86-1486-4778-a990-b970b84c1c16 · outbound

This paper cites NaturalCodeBench: Examining Coding Performance Mismatch on HumanEval and Natural User Prompts.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators NaturalCodeBench: Examining Coding Performance Mismatch on HumanEval and Natural User Prompts

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:28.467608Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:28.467608Z digest=sha256:ca3051cd33b843ff9d1ccf807f6a6660acdb9a007b0cc1fad61a37dfb316ce96

Observation dd3f18c5-5e10-43a6-ad1f-60500951a413 · outbound

This paper cites doi: 10.18653/v1/2024.findings-acl.762.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators doi: 10.18653/v1/2024.findings-acl.762

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:28.544826Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:28.544826Z digest=sha256:673a71c12084cf45db13f6fe93ce3e67bc5fbbea68507f21f9a9c6281ba3a716

Observation b367fcbe-3f42-4b12-972c-c2789e8c36da · outbound

This paper cites LiveCodeBench Pro: How Do Olympiad Medalists Judge LLMs in Competitive Programming?.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators LiveCodeBench Pro: How Do Olympiad Medalists Judge LLMs in Competitive Programming?

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:28.722411Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:28.722411Z digest=sha256:5f747900618eb37f089933a17c6161531eacb4c29c1a36a8a0cf1dc4ad683eed

Observation 3d73353c-3220-4953-9140-324f45194dad · outbound

This paper cites RefineCoder: Iterative Improving of Large Language Models via Adaptive Critique Refinement for Code Generation.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators RefineCoder: Iterative Improving of Large Language Models via Adaptive Critique Refinement for Code Generation

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:28.851648Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:28.851648Z digest=sha256:ec38d66dc7da7347969ef35940c5fdfb252c3d7b13f4454569bec467812813f2

Observation 13979a02-a595-4766-af05-c8b0caeed694 · outbound

This paper cites OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics

Reference 28

Resolution
verified exact
local_arxiv, observed 2026-08-05T21:18:29.439278Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-05T21:18:28.946759Z digest=sha256:79c60f14d18f2ee9999d6c81c6bf14a284c5041d4598a983f8bbe3a91aa289be

Observation 96c61cb4-bdfe-4e48-a81e-6586fbc8ad55 · outbound

This paper cites __main__.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators __main__

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T21:18:45.388228Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-05T21:18:29.054637Z digest=sha256:00fee810361bcb21a97d05ac04b88aa2e0785295dceccdef8b821764054637b7

Observation 8eefd89b-f45a-4c78-80ed-437b17880e0f · outbound

This paper cites 22 # Code Benchmark Construction TaskIn order to build the code benchmark, I need you to help me create a Python function, as well as two test functions.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators 22 # Code Benchmark Construction TaskIn order to build the code benchmark, I need you to help me create a Python function, as well as two test functions

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T21:18:45.076736Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-05T21:18:29.153977Z digest=sha256:12000feaba80a06d35ad8bb3f67eaa9e71c941aa893449208e75086661945bf8

Observation 93d537fe-9023-497f-ac4f-9767c15470aa · outbound

This paper cites Qwen3 Technical Report.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators Qwen3 Technical Report

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:28.164750Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:28.164750Z digest=sha256:5bc27b5e80c608ef98193931a6fbaabdf39bbcd2b647ace7ef53723aed6a54c8

Observation bcc817ce-4445-42ca-aa1a-d741bb9ca7ad · outbound

This paper cites Program Synthesis with Large Language Models.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators Program Synthesis with Large Language Models

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:26.165195Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:26.165195Z digest=sha256:acf5c1c0eb3836e41514afa577872aff65e0184b6be4863d00df6e2dfe458c65

Observation 97742432-eee2-45d9-8f71-b792fa671509 · outbound

This paper cites MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:26.294753Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:26.294753Z digest=sha256:9a633642c719c93a7855bd75328449efb85a87ed6220501179f4a333b5ac1bc0

Observation 70e884f0-4d1e-45ba-8361-a00a8099eb0a · outbound

This paper cites DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:26.575634Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:26.575634Z digest=sha256:394d66312f5ca63f10d4d59bbed497d90a58eacde5faa2563542bc9ae1cdb192

Observation 5114ecfe-fb52-4e44-8466-be759840ff37 · outbound

This paper cites OpenCodeInstruct: A Large-scale Instruction Tuning Dataset for Code LLMs.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators OpenCodeInstruct: A Large-scale Instruction Tuning Dataset for Code LLMs

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:25.994910Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:25.994910Z digest=sha256:66e3365cfc7b36142205c011f4d230d0b56be1d93369f6fb2f436c2bfefdf8c3

Pith citing papers

Observation 7371962a-864c-4fe9-b8c9-13480715b815 · inbound

From Prompt Optimization to Multi-Dimensional Credibility Evaluation: Enhancing Trustworthiness of Chinese LLM-Generated Liver MRI Reports -- with Preliminary Extension to Lung Cancer cites this paper.

From Prompt Optimization to Multi-Dimensional Credibility Evaluation: Enhancing Trustworthiness of Chinese LLM-Generated Liver MRI Reports -- with Preliminary Extension to Lung Cancer AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-04T08:03:36.759783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T08:03:36.759783Z digest=sha256:9ff1d60e59ff70da11eed155e5a95891bd060deac4e7319d82c2de2acefa81ef

Observation 4c58ae96-276a-4872-823c-8b0dc95a06ac · inbound

SkillFlow:Benchmarking Lifelong Skill Discovery and Evolution for Autonomous Agents cites this paper.

SkillFlow:Benchmarking Lifelong Skill Discovery and Evolution for Autonomous Agents AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators

Reference 7

Resolution
metadata mismatch
arxiv_id, observed 2026-05-10T06:21:27.166102Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-10T06:13:32.434201Z digest=sha256:d1212a7b7be27c50772374c356eb1b83538cd632d9fd12c34166683bb42154f3

Observation 047e65da-4768-4396-9fd1-9824a011065d · inbound

BenchCAD: A Comprehensive, Industry-Standard Benchmark for Programmatic CAD cites this paper.

BenchCAD: A Comprehensive, Industry-Standard Benchmark for Programmatic CAD AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators

Reference 10

Resolution
metadata mismatch
arxiv_id, observed 2026-05-12T06:56:26.856757Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-05-12T03:50:08.540154Z digest=sha256:35a53d0ab8cb110ec827c57be676466b8ac2c4ebf44ab963e4126cf4c01dc871

Observation 73863823-1d47-4baa-98a7-64b200170ad5 · inbound

BenchCAD: A Comprehensive, Industry-Standard Benchmark for Programmatic CAD cites this paper.

BenchCAD: A Comprehensive, Industry-Standard Benchmark for Programmatic CAD AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators

Reference 10

Resolution
metadata mismatch
arxiv_id, observed 2026-05-13T03:02:10.397601Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-05-13T02:57:54.534780Z digest=sha256:4997115b844075020832251504777f44f91ea1092eb680527b323d70d40aca96

Observation b6d6a3cd-23bd-4de5-b7da-61bbe650cd73 · inbound

PerfCodeBench: Benchmarking LLMs for System-Level High-Performance Code Optimization cites this paper.

PerfCodeBench: Benchmarking LLMs for System-Level High-Performance Code Optimization AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators

Reference 6

Resolution
metadata mismatch
arxiv_id, observed 2026-05-19T18:03:10.102773Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-19T18:03:07.156185Z digest=sha256:1ca0606c53156697fdedd198e272ef35872cb6e02a2881ca338a3bba432fa203

Observation 20d73053-a8b1-4e43-9d1c-3281bf908ec5 · inbound

PBT-Bench: Benchmarking AI Agents on Property-Based Testing cites this paper.

PBT-Bench: Benchmarking AI Agents on Property-Based Testing AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators

Reference 3

Resolution
verified exact
arxiv_id, observed 2026-05-19T17:27:41.334004Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-19T17:25:00.033951Z digest=sha256:40a9b5300cb3a7b13be39b6d3fadd5e811bbd8ea5c5af5161f9310a78ac29164

Observation 6ce5e85f-b918-4633-a49a-516fb707b71b · inbound

PBT-Bench: Benchmarking AI Agents on Property-Based Testing cites this paper.

PBT-Bench: Benchmarking AI Agents on Property-Based Testing AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators

Reference 3

Resolution
verified exact
arxiv_id, observed 2026-05-21T07:59:50.106865Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-21T07:58:17.923151Z digest=sha256:b4abce8160b6d5eb432e05cff6b3e594d8354f4ea8f7b7c9b468443d279fb236

Observation 497e3519-f1de-4a52-9bd7-b0c5b14b951f · inbound

PBT-Bench: Benchmarking AI Agents on Property-Based Testing cites this paper.

PBT-Bench: Benchmarking AI Agents on Property-Based Testing AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators

Reference 3

Resolution
verified exact
arxiv_id, observed 2026-07-01T14:25:47.101402Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-06-30T21:18:55.451558Z digest=sha256:7ea2efcbcac60ea3259c6dd0a69fe4f70f01cd996ed33667f162874f0338011c

Observation 8bed6de6-6e17-4131-9582-0a657bbfb095 · inbound

Code-QA-Bench: Separating Code Reasoning from Documentation Memorization in Repository-Level QA cites this paper.

Code-QA-Bench: Separating Code Reasoning from Documentation Memorization in Repository-Level QA AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators

Reference 5

Resolution
metadata mismatch
arxiv_id, observed 2026-06-29T07:03:12.926179Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-06-29T07:00:07.102425Z digest=sha256:bbed5489a2c74029ef4393ce31195d902fde106785283fd338b70cd93d73253d

Observation 3bdce69e-548b-480a-8975-a62cb8b0a0b5 · inbound

PERFOPT-Bench: Evaluating Coding Agents on Software Performance Optimization cites this paper.

PERFOPT-Bench: Evaluating Coding Agents on Software Performance Optimization AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators

Reference 36

Resolution
verified exact
local_arxiv, observed 2026-07-10T19:57:33.806970Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-07-10T19:53:34.169337Z digest=sha256:2290fbced2afd2955eeb554dd66d9321d96eac50abef264d15d3770a1a1c2980

Observation 452afdc8-54b1-40b5-894c-937eddea0652 · inbound

Cross-Domain Hybrid OPD for Generalizable Search Agents cites this paper.

Cross-Domain Hybrid OPD for Generalizable Search Agents AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-04T15:13:50.935010Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:13:50.935010Z digest=sha256:b364b699b5efdd02d336c6e70bc2b3388d3ba1d76caca8899424cc66beb6cd74