Pith. sign in

Paper Citation Record · LEDGER

TESTEVAL: Benchmarking Large Language Models for Test Case Generation

As of 23 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 22 inbound Pith citation observations for arXiv:2406.04531.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2406.04531 v2

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 22 of 22 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-22T06:32:14.747728+00:00

measured 22 of 22 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-16T12:33:32.232403Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-23T03:45:21.838589Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation 837d1432-5f95-4300-9c6e-f07d75c224c4 · inbound

REACCEPT: Automated Co-evolution of Production and Test Code Based on Dynamic Validation and Large Language Models cites this paper.

REACCEPT: Automated Co-evolution of Production and Test Code Based on Dynamic Validation and Large Language Models TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-12T19:07:12.614734Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T19:07:12.614734Z digest=sha256:6cb2d2867b2466b6a564f87ba91140fa5dd0e016a21eab9d0ca9abdb1a3f7fe8

Observation 5490c4a6-3505-4454-9177-e7cfddec532c · inbound

TDD-Bench Verified: Can LLMs Generate Tests for Issues Before They Get Resolved? cites this paper.

TDD-Bench Verified: Can LLMs Generate Tests for Issues Before They Get Resolved? TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-11T23:02:34.234758Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T23:02:34.234758Z digest=sha256:15d1ded023a0064e7f1ed7079ce9c0302cb50ac533e2cb631cf7266df983bc13

Observation 40c66808-3128-4f3b-92be-b0360d3eaa23 · inbound

Fine-grained Testing for Autonomous Driving Software: a Study on Autoware with LLM-driven Unit Testing cites this paper.

Fine-grained Testing for Autonomous Driving Software: a Study on Autoware with LLM-driven Unit Testing TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-10T19:38:56.440049Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T19:38:56.440049Z digest=sha256:30f70df557d489fd28f0ad2d1cfe7a57f170bfaed2d314637238751f32cbddc8

Observation a62b8d6b-1162-4109-ad1e-f8491b2341ad · inbound

COFFE: A Code Efficiency Benchmark for Code Generation cites this paper.

COFFE: A Code Efficiency Benchmark for Code Generation TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 83

Resolution
unresolved
no resolver link, observed 2026-08-09T11:01:28.042521Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T11:01:28.042521Z digest=sha256:b00e5191b37750ab36dec236cb63586d8a4d7dc87f10b001a71853ed60614b62

Observation e62d82f9-7f1f-4ba6-b0d1-9ee74177fabb · inbound

MultiFileTest: A Multi-File-Level LLM Unit Test Generation Benchmark and Impact of Error Fixing Mechanisms cites this paper.

MultiFileTest: A Multi-File-Level LLM Unit Test Generation Benchmark and Impact of Error Fixing Mechanisms TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 27

Resolution
verified exact
arxiv_id, observed 2026-05-23T03:45:21.841847Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-05-23T03:42:36.946141Z digest=sha256:dda8c84acee92f33c5265365e4d6f4426c93ff2f8cb2cde190e91d8509d24788

Observation a243c40a-07ad-4554-8a41-896446ed20d4 · inbound

CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification cites this paper.

CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T23:42:26.077466Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T23:42:26.077466Z digest=sha256:9b3cf7f33b8f8f2cf2bc73b0053cf7fa3eb28b9db0beb34bef587dde3de58c29

Observation cacf09e4-f4a4-41de-8dcb-b02c5ff37c41 · inbound

Code Copycat Conundrum: Demystifying Repetition in LLM-based Code Generation cites this paper.

Code Copycat Conundrum: Demystifying Repetition in LLM-based Code Generation TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-16T12:33:32.232403Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:33:32.232403Z digest=sha256:25a0d033656b0be13cb6d768fbffeac9a94dd14e98b2b7e7eefa868e1e62bb08

Observation f728db31-5215-4a8c-973f-b9a145ca64b7 · inbound

Risk Assessment Framework for Code LLMs via Leveraging Internal States cites this paper.

Risk Assessment Framework for Code LLMs via Leveraging Internal States TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-16T11:49:03.338625Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:49:03.338625Z digest=sha256:d98d0592d63b366d5e9e9383b7dc6ac7d5f900c638a7e391e648105f553da321

Observation 3c25c92e-8739-4e20-a05a-7a6aa9a60f6c · inbound

LogiCase: Effective Test Case Generation from Logical Description in Competitive Programming cites this paper.

LogiCase: Effective Test Case Generation from Logical Description in Competitive Programming TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T15:29:29.018544Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:29:29.018544Z digest=sha256:34d6432d5778f7a68fc425a2884801f0ce315455774b08bc05e689b0d6db46c3

Observation 9d92569e-dd0a-41c5-9707-ddcccb60ff5d · inbound

HardTests: Synthesizing High-Quality Test Cases for LLM Coding cites this paper.

HardTests: Synthesizing High-Quality Test Cases for LLM Coding TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T12:39:57.721681Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:39:57.721681Z digest=sha256:c14b198f36ada5ddbdde108bbce93a07f594bc0d19b8c20041dc0ba68661b613

Observation c8dd2967-7dad-4ddb-92c4-0b4440ca6fe5 · inbound

SAGE:Specification-Aware Grammar Extraction for Automated Test Case Generation with LLMs cites this paper.

SAGE:Specification-Aware Grammar Extraction for Automated Test Case Generation with LLMs TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T11:00:46.175257Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:00:46.175257Z digest=sha256:6561c34b1f960efd40acf2f5f94fcc17b5d3045faf7e3f498ab198ad2d0e860f

Observation 572a3131-a99b-4f23-952b-17e21831f1ab · inbound

Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure cites this paper.

Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T00:59:56.751560Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T00:59:56.751560Z digest=sha256:0f568711f56e2bb30ea5f21919178c6dbe186f2667a76643f3f5c0ed328f5955

Observation b1dfdd0d-4132-4f74-812e-af48be32b323 · inbound

Rethinking Verification for LLM Code Generation: From Generation to Testing cites this paper.

Rethinking Verification for LLM Code Generation: From Generation to Testing TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-06T18:58:21.179980Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:58:21.179980Z digest=sha256:6c6dd3fa774b5ce608a43b3a3e5101a6a9531853667cf96622679c41ad6bbdb6

Observation 29603517-e653-4063-81b1-b10fab08a9be · inbound

Benchmarking LLMs for Unit Test Generation from Real-World Functions cites this paper.

Benchmarking LLMs for Unit Test Generation from Real-World Functions TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-06T10:15:37.152164Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T10:15:37.152164Z digest=sha256:eb601a3d4161cecca4c13d30106281a5426666891d9af7bd85731e5306b06dd4

Observation 214df8df-4d55-4d8b-8b60-df4ca738944b · inbound

HyClone: Bridging LLM Understanding and Dynamic Execution for Semantic Code Clone Detection cites this paper.

HyClone: Bridging LLM Understanding and Dynamic Execution for Semantic Code Clone Detection TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T05:41:35.125310Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T05:41:35.125310Z digest=sha256:12a77b24f8803cd9ccb6c851db11ba7e602571fe1746be9f8de4a5316a3b00d3

Observation 51e82265-4c6e-475d-b8c2-67658a7c9de5 · inbound

Trade Policy and Structural Change cites this paper.

Trade Policy and Structural Change TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T05:42:31.110819Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:42:31.110819Z digest=sha256:7ebbe08f0d02caad2cd4238ceeb06580a43eda06e86e73a36f05f1361fe3b5df

Observation f1ef20a3-8da8-4d4d-8f12-4e68ed204cb4 · inbound

Comparative Evaluation of Large Language Models for Test-Skeleton Generation cites this paper.

Comparative Evaluation of Large Language Models for Test-Skeleton Generation TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-05T05:59:43.828934Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T05:59:43.828934Z digest=sha256:88af33e5efc0a1103338e7b22e9e5eef7e7ac9c23b608f43b9283a742ff300d5

Observation 38fcef46-524a-4424-b4da-f838e2524139 · inbound

SWE-EVO: Benchmarking Coding Agents in Long-Horizon Software Evolution Scenarios cites this paper.

SWE-EVO: Benchmarking Coding Agents in Long-Horizon Software Evolution Scenarios TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 48

Resolution
verified exact
arxiv_id, observed 2026-05-16T20:28:24.556378Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-05-16T20:24:40.939455Z digest=sha256:164eff76b73aef70b1d3228231a77ec7a4d6057b4c659797a6adfaa51fb4d5d9

Observation 85fa6c92-2013-42c9-891f-6a7e09f2217b · inbound

WebMAC: A Multi-Agent Collaborative Framework for Scenario Testing of Web Systems cites this paper.

WebMAC: A Multi-Agent Collaborative Framework for Scenario Testing of Web Systems TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-05-10T13:45:28.438819Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-05-10T13:41:03.668751Z digest=sha256:10d3602b60033b4f1627cdca6f735a1080452abdf4198c1ec2372035b9dd9333

Observation b969a3ee-17eb-413c-8bd2-5218a0ec3286 · inbound

Enhancing Large Language Models with Retrieval Augmented Generation for Software Testing and Inspection Automation cites this paper.

Enhancing Large Language Models with Retrieval Augmented Generation for Software Testing and Inspection Automation TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-05-10T10:44:37.956799Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-05-10T10:40:30.734804Z digest=sha256:e6477575dec626919824818de08dc753d066be9112fed08ab34b923a691f966b

Observation 186f474c-93d4-4942-af0e-5c2d5ddf9276 · inbound

SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle cites this paper.

SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 33

Resolution
verified exact
arxiv_id, observed 2026-05-14T18:37:35.700926Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-05-14T18:34:39.997353Z digest=sha256:d268cf1d0d76e4c0244bff5a69e9c237cd3f5bb41b650c92ce02ada1c7d40ffa

Observation 7d6fcf0e-0f6f-4658-b4c6-e4c008823898 · inbound

SCATE: Learning to Supervise Coding Agents for Cost-Effective Test Generation cites this paper.

SCATE: Learning to Supervise Coding Agents for Cost-Effective Test Generation TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 51

Resolution
unresolved
no resolver link, observed 2026-07-13T01:15:01.090791Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T01:15:01.090791Z digest=sha256:019af79691d8ce721ca61a55fce493514d680fbd2358580c1b6b40d95bf4ebef