Pith. sign in

Paper Citation Record · LEDGER

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators

As of 15 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 11 inbound Pith citation observations for arXiv:2508.09101.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2508.09101 v1

Coverage vector

measured 30 of 30 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-05T21:18:29.153977Z

measured 41 of 41 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-15T06:32:42.880941+00:00

measured 11 of 11 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-04T15:13:50.935010Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-08-05T02:28:24.338817Z

Reference resolution

30 of 30 outbound references displayed

  • verified exact1
  • verified fuzzy2
  • unresolved27
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

0
pith, observed 2026-08-05T02:28:24.338817Z

Outbound references

Observation 404202ab-2ac9-4e89-8da3-dda9575e996a · outbound

This paper cites SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:26.079582Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:26.079582Z digest=sha256:e9df0ec5b54599ea5dadae930c404f8eb615cbad14bfd8265f12da4b4dd85a27

Observation 9f4636e5-23dd-41ba-983f-f6bc70d50431 · outbound

This paper cites Evaluating Large Language Models Trained on Code.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators Evaluating Large Language Models Trained on Code

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:26.382315Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:26.382315Z digest=sha256:1a460419ba07c9fe74f278e2fb5cbb99fabad6c473506b447fec6a6b944f69b1

Observation 88c0a9ab-50c2-47c8-baa9-c206e77a5ff7 · outbound

This paper cites DeepSeek-V3 Technical Report.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators DeepSeek-V3 Technical Report

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:26.487023Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:26.487023Z digest=sha256:37bffb9f8c54f7668fc56419f2f724db6786712a3d1ffe05455accdc0c832665

Observation bc1b5865-60ff-4b34-ace1-859c6c1ec486 · outbound

This paper cites Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:26.684754Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:26.684754Z digest=sha256:e48714884fddecb697c7739ba783db9ace266088ed84077089696b4187c532c1

Observation 5e425ee9-5964-4615-9b3b-667575a21e79 · outbound

This paper cites DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:26.806206Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:26.806206Z digest=sha256:104be4f52b1058dc170c41dc2037630835ef1213a2833803317be1a62af58b46

Observation fa5a5a28-0ac1-4775-851b-8c5c793c757c · outbound

This paper cites CodeEditorBench: Evaluating Code Editing Capability of Large Language Models.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators CodeEditorBench: Evaluating Code Editing Capability of Large Language Models

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:26.902628Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:26.902628Z digest=sha256:b4b746eaa71bc509b58c735a4f9d1efcd5fa11e6d6ba3f5f8e8fced007e505f7

Observation 00d38d5b-e319-42f8-aae5-5374c6abcd54 · outbound

This paper cites OpenCoder: The Open Cookbook for Top-Tier Code Large Language Models.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators OpenCoder: The Open Cookbook for Top-Tier Code Large Language Models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:27.044990Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:27.044990Z digest=sha256:c0731b9828913a585a699700f6460007fb1178700e2a7fdf911eafa818134a73

Observation 6975957d-e735-491d-823a-f8a3aa8a3483 · outbound

This paper cites A Survey on Large Language Models for Code Generation.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators A Survey on Large Language Models for Code Generation

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:27.251061Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:27.251061Z digest=sha256:a97d04f164b3b26f1c94b68fdcc3e20fc735c0d1d17f8cb3fe9b5c67127cf98b

Observation 67f9ac42-4e66-4c4a-9d08-e37b918d8067 · outbound

This paper cites SWE-bench: Can Language Models Resolve Real-World GitHub Issues?.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators SWE-bench: Can Language Models Resolve Real-World GitHub Issues?

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:27.367469Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:27.367469Z digest=sha256:79ef548e4cc18b9ead2b75ef99d627797bd365116a205a5a362d938b99d80ea1

Observation 374da8da-6e88-42f5-a76b-56d2633b4d27 · outbound

This paper cites Kimi K2: Open Agentic Intelligence.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators Kimi K2: Open Agentic Intelligence

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:27.496436Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:27.496436Z digest=sha256:ea0089a8ce3b47c571080772af20c42fcc7bf51bb1471ff85a93a57d535f1495

Observation 286b0d4e-c561-4888-9959-9117a668303d · outbound

This paper cites doi: 10.1126/science.abq1158.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators doi: 10.1126/science.abq1158

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:27.605502Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:27.605502Z digest=sha256:6f62c22fab193b569b2405fccc52354d4157c76d2115c7fcef439c0ddd3e2b71

Observation a6400a4c-50e6-481e-bee3-ff5cc6e04de4 · outbound

This paper cites HumanEval-XL: A Multilingual Code Generation Benchmark for Cross-lingual Natural Language Generalization.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators HumanEval-XL: A Multilingual Code Generation Benchmark for Cross-lingual Natural Language Generalization

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:27.684747Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:27.684747Z digest=sha256:14695452955ffa45f960a1586ae776b3942011ab39c1651457c1d2df47af0d71

Observation 17e42d19-1e94-48f3-aa19-8c9786923d78 · outbound

This paper cites CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:27.805253Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:27.805253Z digest=sha256:3816a992e2ae59f0528d18220cb8abd04ecc5b47b707cf273a2901c8bcc6581a

Observation 89d7ccf0-3ccd-4544-97a7-104087f96718 · outbound

This paper cites Qwen2.5 Technical Report.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators Qwen2.5 Technical Report

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:27.886461Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:27.886461Z digest=sha256:c05198426adc451e0c78f479f9dccb5bab86eceddca45aec461b212aa001c761

Observation f91e24b2-3419-459c-81de-f8f935449a3f · outbound

This paper cites Seed-Coder: Let the Code Model Curate Data for Itself.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators Seed-Coder: Let the Code Model Curate Data for Itself

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:27.964338Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:27.964338Z digest=sha256:3d6a99deee0c2ecb0619c40e75843c60ef29b0417f9a72cb10e5f38ca9bc1590

Observation 198c1050-280b-453d-ac36-ed6b2c83b42c · outbound

This paper cites Kaixin Wang, Tianlin Li, Xiaoyu Zhang, Chong Wang, Weisong Sun, Yang Liu, and Bin Shi.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators Kaixin Wang, Tianlin Li, Xiaoyu Zhang, Chong Wang, Weisong Sun, Yang Liu, and Bin Shi

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:28.059166Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:28.059166Z digest=sha256:0081067ac54b925f9505e3affa58e356947cc3683507a147c3b0609e32b79be7

Observation 8f29a7ea-cecd-4d38-b937-1b72fb680195 · outbound

This paper cites WaveCoder: Widespread And Versatile Enhancement For Code Large Language Models By Instruction Tuning.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators WaveCoder: Widespread And Versatile Enhancement For Code Large Language Models By Instruction Tuning

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:28.245399Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:28.245399Z digest=sha256:ac7357de41e15916bfe719c44e94eb6c86e2db1dd0211e9266d53fe8193d8f3e

Observation 95dcbbed-88af-4ba4-8607-d4235f3ba155 · outbound

This paper cites Multi-SWE-bench: A Multilingual Benchmark for Issue Resolving.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators Multi-SWE-bench: A Multilingual Benchmark for Issue Resolving

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:28.374667Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:28.374667Z digest=sha256:6a73b9276460529097ff2ee49d58eb412a6dc7b248acf0f94ae269ea5f8b0f5c

Observation 71b73a86-1486-4778-a990-b970b84c1c16 · outbound

This paper cites NaturalCodeBench: Examining Coding Performance Mismatch on HumanEval and Natural User Prompts.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators NaturalCodeBench: Examining Coding Performance Mismatch on HumanEval and Natural User Prompts

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:28.467608Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:28.467608Z digest=sha256:12a06b28e73d7b3a49fc4264601d4949d2349f13e9650bc721f639e0c2c000d2

Observation dd3f18c5-5e10-43a6-ad1f-60500951a413 · outbound

This paper cites doi: 10.18653/v1/2024.findings-acl.762.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators doi: 10.18653/v1/2024.findings-acl.762

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:28.544826Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:28.544826Z digest=sha256:0f407fcd2bb8a180d9c4ec6cbc5aa1d40bb11bf45428a210912e8e381e34bf61

Observation b367fcbe-3f42-4b12-972c-c2789e8c36da · outbound

This paper cites LiveCodeBench Pro: How Do Olympiad Medalists Judge LLMs in Competitive Programming?.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators LiveCodeBench Pro: How Do Olympiad Medalists Judge LLMs in Competitive Programming?

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:28.722411Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:28.722411Z digest=sha256:d5f1e4ea2202d63fe28b8cb8041327ab85f4a9a0023ac09774b53f420d1ce5ee

Observation 3d73353c-3220-4953-9140-324f45194dad · outbound

This paper cites RefineCoder: Iterative Improving of Large Language Models via Adaptive Critique Refinement for Code Generation.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators RefineCoder: Iterative Improving of Large Language Models via Adaptive Critique Refinement for Code Generation

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:28.851648Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:28.851648Z digest=sha256:b01871f3930e4e869f56c149057770c56de505a31efb1241054714314ba93244

Observation 13979a02-a595-4766-af05-c8b0caeed694 · outbound

This paper cites OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics

Reference 28

Resolution
verified exact
local_arxiv, observed 2026-08-05T21:18:29.439278Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-05T21:18:28.946759Z digest=sha256:dcb1f65b83ad1f63290181d566dca1aee2cad09dea30a8bdceef36f13d26f04f

Observation 96c61cb4-bdfe-4e48-a81e-6586fbc8ad55 · outbound

This paper cites __main__.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators __main__

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T21:18:45.388228Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-05T21:18:29.054637Z digest=sha256:6559d935a82853a427e72ef6202061bbe97ebe5df0541f6e5d932455c77bdf27

Observation 8eefd89b-f45a-4c78-80ed-437b17880e0f · outbound

This paper cites 22 # Code Benchmark Construction TaskIn order to build the code benchmark, I need you to help me create a Python function, as well as two test functions.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators 22 # Code Benchmark Construction TaskIn order to build the code benchmark, I need you to help me create a Python function, as well as two test functions

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T21:18:45.076736Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-05T21:18:29.153977Z digest=sha256:41f9ff7862344d622f85b1647172a6700fce178ee3d43e1f92f90aab15239647

Observation 93d537fe-9023-497f-ac4f-9767c15470aa · outbound

This paper cites Qwen3 Technical Report.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators Qwen3 Technical Report

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:28.164750Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:28.164750Z digest=sha256:29ca401029c8556d1208746337afce9d89fa4debd219b9eaed0163ca35043f60

Observation bcc817ce-4445-42ca-aa1a-d741bb9ca7ad · outbound

This paper cites Program Synthesis with Large Language Models.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators Program Synthesis with Large Language Models

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:26.165195Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:26.165195Z digest=sha256:250cf9de278f94b854676a5815c510ddc1a54697e6ad98667c95afefe12c5796

Observation 97742432-eee2-45d9-8f71-b792fa671509 · outbound

This paper cites MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:26.294753Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:26.294753Z digest=sha256:58e2da6f007773dcade69b3d672c1241d3680abd559b48fdb7d3436e53c75b1b

Observation 70e884f0-4d1e-45ba-8361-a00a8099eb0a · outbound

This paper cites DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:26.575634Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:26.575634Z digest=sha256:1c82be66f4d30e5a4ccd6d3c3c7a7d229634ec8aa4c750a5ed3ddc00ab3ac5dc

Observation 5114ecfe-fb52-4e44-8466-be759840ff37 · outbound

This paper cites OpenCodeInstruct: A Large-scale Instruction Tuning Dataset for Code LLMs.

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators OpenCodeInstruct: A Large-scale Instruction Tuning Dataset for Code LLMs

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-05T21:18:25.994910Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T21:18:25.994910Z digest=sha256:ed1ff065a480d863dd2d779ff0f5095d83a1a329c8efc186256c872b8964482b

Pith citing papers

Observation 7371962a-864c-4fe9-b8c9-13480715b815 · inbound

From Prompt Optimization to Multi-Dimensional Credibility Evaluation: Enhancing Trustworthiness of Chinese LLM-Generated Liver MRI Reports -- with Preliminary Extension to Lung Cancer cites this paper.

From Prompt Optimization to Multi-Dimensional Credibility Evaluation: Enhancing Trustworthiness of Chinese LLM-Generated Liver MRI Reports -- with Preliminary Extension to Lung Cancer AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-04T08:03:36.759783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T08:03:36.759783Z digest=sha256:d84b728c9d10ecaa138bf1c36ad81079e42a217eaafdadbf8834a03512df3c22

Observation 4c58ae96-276a-4872-823c-8b0dc95a06ac · inbound

SkillFlow:Benchmarking Lifelong Skill Discovery and Evolution for Autonomous Agents cites this paper.

SkillFlow:Benchmarking Lifelong Skill Discovery and Evolution for Autonomous Agents AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators

Reference 7

Resolution
metadata mismatch
arxiv_id, observed 2026-05-10T06:21:27.166102Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-10T06:13:32.434201Z digest=sha256:6af2bc1e36b92205900e459bff5f79b355550204bb9d9bcaf015c89ce1a9b55d

Observation 047e65da-4768-4396-9fd1-9824a011065d · inbound

BenchCAD: A Comprehensive, Industry-Standard Benchmark for Programmatic CAD cites this paper.

BenchCAD: A Comprehensive, Industry-Standard Benchmark for Programmatic CAD AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators

Reference 10

Resolution
metadata mismatch
arxiv_id, observed 2026-05-12T06:56:26.856757Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=arxiv_source observed=2026-05-12T03:50:08.540154Z digest=sha256:ef6ca2fac86276255318eb4d175c3f378f653cf99a2de33c9fb98c9d73f3518c

Observation 73863823-1d47-4baa-98a7-64b200170ad5 · inbound

BenchCAD: A Comprehensive, Industry-Standard Benchmark for Programmatic CAD cites this paper.

BenchCAD: A Comprehensive, Industry-Standard Benchmark for Programmatic CAD AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators

Reference 10

Resolution
metadata mismatch
arxiv_id, observed 2026-05-13T03:02:10.397601Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=arxiv_source observed=2026-05-13T02:57:54.534780Z digest=sha256:e11ce0af1bf559b8d6c9301e92fe455d3a139c578c5b09e45a3625020c5a2de2

Observation b6d6a3cd-23bd-4de5-b7da-61bbe650cd73 · inbound

PerfCodeBench: Benchmarking LLMs for System-Level High-Performance Code Optimization cites this paper.

PerfCodeBench: Benchmarking LLMs for System-Level High-Performance Code Optimization AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators

Reference 6

Resolution
metadata mismatch
arxiv_id, observed 2026-05-19T18:03:10.102773Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-19T18:03:07.156185Z digest=sha256:bc85d96148cd1f6ac28e09cc9e8b1682bb4854bde56f8850eb939863af1da169

Observation 20d73053-a8b1-4e43-9d1c-3281bf908ec5 · inbound

PBT-Bench: Benchmarking AI Agents on Property-Based Testing cites this paper.

PBT-Bench: Benchmarking AI Agents on Property-Based Testing AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators

Reference 3

Resolution
verified exact
arxiv_id, observed 2026-05-19T17:27:41.334004Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-19T17:25:00.033951Z digest=sha256:95204c68c286da722ee9d72fb4bab46a2f5ab094e8753dc040a7291b984e2ba6

Observation 6ce5e85f-b918-4633-a49a-516fb707b71b · inbound

PBT-Bench: Benchmarking AI Agents on Property-Based Testing cites this paper.

PBT-Bench: Benchmarking AI Agents on Property-Based Testing AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators

Reference 3

Resolution
verified exact
arxiv_id, observed 2026-05-21T07:59:50.106865Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-21T07:58:17.923151Z digest=sha256:aa7f97f27ea6757084d2d150cbbd6346f54963168117cef08ef60448bbeb32a9

Observation 497e3519-f1de-4a52-9bd7-b0c5b14b951f · inbound

PBT-Bench: Benchmarking AI Agents on Property-Based Testing cites this paper.

PBT-Bench: Benchmarking AI Agents on Property-Based Testing AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators

Reference 3

Resolution
verified exact
arxiv_id, observed 2026-07-01T14:25:47.101402Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-06-30T21:18:55.451558Z digest=sha256:524631f771f45c4d9f9792b5ca3c4d717a0a6f9c32af975b7a739d824cd44d4f

Observation 8bed6de6-6e17-4131-9582-0a657bbfb095 · inbound

Code-QA-Bench: Separating Code Reasoning from Documentation Memorization in Repository-Level QA cites this paper.

Code-QA-Bench: Separating Code Reasoning from Documentation Memorization in Repository-Level QA AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators

Reference 5

Resolution
metadata mismatch
arxiv_id, observed 2026-06-29T07:03:12.926179Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-06-29T07:00:07.102425Z digest=sha256:fef0b48812453bd9a68998c6c7aa70a8ca43c9c74a4dc1a2193f5ba86a9ed8cc

Observation 3bdce69e-548b-480a-8975-a62cb8b0a0b5 · inbound

PERFOPT-Bench: Evaluating Coding Agents on Software Performance Optimization cites this paper.

PERFOPT-Bench: Evaluating Coding Agents on Software Performance Optimization AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators

Reference 36

Resolution
verified exact
local_arxiv, observed 2026-07-10T19:57:33.806970Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=arxiv_source observed=2026-07-10T19:53:34.169337Z digest=sha256:fe8a0613b8fb125e261383860a2297977a6b67075532841c8c5915ee7cb9e839

Observation 452afdc8-54b1-40b5-894c-937eddea0652 · inbound

Cross-Domain Hybrid OPD for Generalizable Search Agents cites this paper.

Cross-Domain Hybrid OPD for Generalizable Search Agents AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-04T15:13:50.935010Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:13:50.935010Z digest=sha256:db68da5d3f098f7cdd1f759abc4615e6ede87c3af5cdf6b97a575ab3f7496cc1