Pith. sign in

Paper Citation Record · LEDGER

TESTEVAL: Benchmarking Large Language Models for Test Case Generation

As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 15 inbound Pith citation observations for arXiv:2406.04531.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2406.04531 v2

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 15 of 15 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 15 of 15 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T15:29:29.018544Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-23T03:45:21.838589Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation e62d82f9-7f1f-4ba6-b0d1-9ee74177fabb · inbound

MultiFileTest: A Multi-File-Level LLM Unit Test Generation Benchmark and Impact of Error Fixing Mechanisms cites this paper.

MultiFileTest: A Multi-File-Level LLM Unit Test Generation Benchmark and Impact of Error Fixing Mechanisms TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 27

Resolution
verified exact
arxiv_id, observed 2026-05-23T03:45:21.841847Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-05-23T03:42:36.946141Z digest=sha256:3cbe7f5c4645d893f4151c8929099337e30c4cfa0a35a702ef9553140e42bff9

Observation 3c25c92e-8739-4e20-a05a-7a6aa9a60f6c · inbound

LogiCase: Effective Test Case Generation from Logical Description in Competitive Programming cites this paper.

LogiCase: Effective Test Case Generation from Logical Description in Competitive Programming TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T15:29:29.018544Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:29:29.018544Z digest=sha256:943712c584ea5527c54814f3948bbfc17274743b1eec584a7ea6a7d9c53e50e8

Observation 9d92569e-dd0a-41c5-9707-ddcccb60ff5d · inbound

HardTests: Synthesizing High-Quality Test Cases for LLM Coding cites this paper.

HardTests: Synthesizing High-Quality Test Cases for LLM Coding TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T12:39:57.721681Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:39:57.721681Z digest=sha256:938b4675c96d11edecf1f6860d0c187f05cae7fbd59ae9ed5985a09105303d32

Observation c8dd2967-7dad-4ddb-92c4-0b4440ca6fe5 · inbound

SAGE:Specification-Aware Grammar Extraction for Automated Test Case Generation with LLMs cites this paper.

SAGE:Specification-Aware Grammar Extraction for Automated Test Case Generation with LLMs TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T11:00:46.175257Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:00:46.175257Z digest=sha256:95d9715e8630bb5c1987c6d1e83995992a0db684b24028e829e3d4d0ea1beae7

Observation 572a3131-a99b-4f23-952b-17e21831f1ab · inbound

Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure cites this paper.

Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T00:59:56.751560Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T00:59:56.751560Z digest=sha256:f0d7af32ff54b82b0f04f77f7a399dcdc87eecda9d3ba3fb905cc7b1923137d4

Observation b1dfdd0d-4132-4f74-812e-af48be32b323 · inbound

Rethinking Verification for LLM Code Generation: From Generation to Testing cites this paper.

Rethinking Verification for LLM Code Generation: From Generation to Testing TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-06T18:58:21.179980Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:58:21.179980Z digest=sha256:443bb5860d6757fda150c59609546dbf3fcc487079ef4dc4461c741c7aae7850

Observation 29603517-e653-4063-81b1-b10fab08a9be · inbound

Benchmarking LLMs for Unit Test Generation from Real-World Functions cites this paper.

Benchmarking LLMs for Unit Test Generation from Real-World Functions TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-06T10:15:37.152164Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T10:15:37.152164Z digest=sha256:93329f21e29c75d8d1ae87aa0dd4cf2ae424fc86f716cb418b15b27712916571

Observation 214df8df-4d55-4d8b-8b60-df4ca738944b · inbound

HyClone: Bridging LLM Understanding and Dynamic Execution for Semantic Code Clone Detection cites this paper.

HyClone: Bridging LLM Understanding and Dynamic Execution for Semantic Code Clone Detection TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T05:41:35.125310Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T05:41:35.125310Z digest=sha256:bbbb9827dd32956a78f18fcee0551395275684662123f7d883d62a2871a88fa0

Observation 51e82265-4c6e-475d-b8c2-67658a7c9de5 · inbound

Trade Policy and Structural Change cites this paper.

Trade Policy and Structural Change TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T05:42:31.110819Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:42:31.110819Z digest=sha256:5647b8641a8c15aebe763d06183acd1546d2311701e01f9d1f0e614ef682b427

Observation f1ef20a3-8da8-4d4d-8f12-4e68ed204cb4 · inbound

Comparative Evaluation of Large Language Models for Test-Skeleton Generation cites this paper.

Comparative Evaluation of Large Language Models for Test-Skeleton Generation TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-05T05:59:43.828934Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T05:59:43.828934Z digest=sha256:c80b78d09da47925cfd01c43ed7d846ce1df70a9c899865662e92ae24d548b03

Observation 38fcef46-524a-4424-b4da-f838e2524139 · inbound

SWE-EVO: Benchmarking Coding Agents in Long-Horizon Software Evolution Scenarios cites this paper.

SWE-EVO: Benchmarking Coding Agents in Long-Horizon Software Evolution Scenarios TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 48

Resolution
verified exact
arxiv_id, observed 2026-05-16T20:28:24.556378Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-05-16T20:24:40.939455Z digest=sha256:85d6228b2583a689ad78838279be7b2d9462a8e58ecc2a79d81aac9f704aebe0

Observation 85fa6c92-2013-42c9-891f-6a7e09f2217b · inbound

WebMAC: A Multi-Agent Collaborative Framework for Scenario Testing of Web Systems cites this paper.

WebMAC: A Multi-Agent Collaborative Framework for Scenario Testing of Web Systems TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-05-10T13:45:28.438819Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-10T13:41:03.668751Z digest=sha256:30bb7c7f498b6233cca0a559de52598776724b9a3e1e5015d7cc595cf74ed07d

Observation b969a3ee-17eb-413c-8bd2-5218a0ec3286 · inbound

Enhancing Large Language Models with Retrieval Augmented Generation for Software Testing and Inspection Automation cites this paper.

Enhancing Large Language Models with Retrieval Augmented Generation for Software Testing and Inspection Automation TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-05-10T10:44:37.956799Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-10T10:40:30.734804Z digest=sha256:d4e3ab6e4b259b4ec34cb7fbe7b15b7ad7a58cc9903837314706130b41c744a5

Observation 186f474c-93d4-4942-af0e-5c2d5ddf9276 · inbound

SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle cites this paper.

SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 33

Resolution
verified exact
arxiv_id, observed 2026-05-14T18:37:35.700926Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-14T18:34:39.997353Z digest=sha256:cb32561aad30583b6c20afcf3be99749dea80b0ff1391a92d3a0da38e08c2fc0

Observation 7d6fcf0e-0f6f-4658-b4c6-e4c008823898 · inbound

SCATE: Learning to Supervise Coding Agents for Cost-Effective Test Generation cites this paper.

SCATE: Learning to Supervise Coding Agents for Cost-Effective Test Generation TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 51

Resolution
unresolved
no resolver link, observed 2026-07-13T01:15:01.090791Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T01:15:01.090791Z digest=sha256:c54fd291bf4ae50046d0934d132094f85e30af5f9cf9995f1dcdb72a3524a373