Pith. sign in

Paper Citation Record · LEDGER

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation

As of 23 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 3 inbound Pith citation observations for arXiv:2505.09027.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.09027 v1

Coverage vector

measured 52 of 52 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T21:47:07.814079Z

measured 55 of 55 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-23T06:30:58.430688+00:00

measured 3 of 3 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T14:15:49.870701Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-02T21:47:27.669855Z

Reference resolution

52 of 52 outbound references displayed

  • verified exact0
  • verified fuzzy13
  • unresolved39
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 0462b0fe-f9b9-449a-876d-c752e7a6d3b4 · outbound

This paper cites https://fireship.io/, 2017.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation https://fireship.io/, 2017

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T21:47:08.684178Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-15T21:47:07.575875Z digest=sha256:7a3dbc92b85f9623742d8a16471f0ed4b9d8a5632b4f3e0e6f8adff27b454332

Observation 3650eac4-9627-493e-9f51-7021453ed6d3 · outbound

This paper cites https://huggingface.co/spaces/onekq-ai/WebApp1K-models-leaderboard, 2024.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation https://huggingface.co/spaces/onekq-ai/WebApp1K-models-leaderboard, 2024

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T21:47:08.670920Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-15T21:47:07.581244Z digest=sha256:474dac6d6b18c3cfd3bcef1704d402d1f607857e9e46a9ddf2bf2c7ace406a19

Observation dd21de74-1115-4612-92d6-aae255055870 · outbound

This paper cites Fullstack React: The Complete Guide to ReactJS and Friends.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation Fullstack React: The Complete Guide to ReactJS and Friends

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T21:47:08.658109Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-15T21:47:07.586171Z digest=sha256:7fc3df8996702ec2c4f4f853e27fbe3d0ab8149e6b5ff56e2cea82aaabcefb09

Observation 0d262345-6a76-4e2c-a032-ac6fb2a700c5 · outbound

This paper cites W., Tian, Z., and Barber, D.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation W., Tian, Z., and Barber, D

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T21:47:08.644106Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-15T21:47:07.590592Z digest=sha256:129467b3d78eccecfd201a9edd8d2a6db3fb23f919acda45eeea02b422ba7468

Observation 3ff65f97-89f7-4589-ac24-76abb06bcb5f · outbound

This paper cites Program Synthesis with Large Language Models.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation Program Synthesis with Large Language Models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-15T21:47:07.594998Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:47:07.594998Z digest=sha256:63e5cd10ba2081f6b500b8997d91d33302455081861e7b0eb572dd7ad606987f

Observation 720d92f7-4a2a-4aaa-9586-9164d968b40d · outbound

This paper cites Test Driven Development: By Example.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation Test Driven Development: By Example

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T21:47:08.630485Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-15T21:47:07.599971Z digest=sha256:48b22517e9c279619a6adfa47796e7991acb96893c33a504178e0df8d6bee3af

Observation 76ea2de5-545f-4994-994b-648d53a26076 · outbound

This paper cites Evaluating Large Language Models Trained on Code.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation Evaluating Large Language Models Trained on Code

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-15T21:47:07.605847Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:47:07.605847Z digest=sha256:9ef802930075665e3121d5ec45935d94f45d23dac11df0df5e258dbe4819225f

Observation a0584331-f6f9-4d53-872d-dae2d6bb9602 · outbound

This paper cites Batch Prompting: Efficient Inference with Large Language Model APIs.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation Batch Prompting: Efficient Inference with Large Language Model APIs

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-15T21:47:07.610338Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:47:07.610338Z digest=sha256:416e9ca54a41145fa991ed4a90e0515251e8dc51c435795708675b2da19b125c

Observation 04b4a062-6245-4b85-926f-29b4690499bb · outbound

This paper cites INSTRUCTEVAL: Towards Holistic Evaluation of Instruction-Tuned Large Language Models.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation INSTRUCTEVAL: Towards Holistic Evaluation of Instruction-Tuned Large Language Models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-15T21:47:07.615092Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:47:07.615092Z digest=sha256:f59ca8de163b168f9e2484174eac67c077f5b08a33ef7139b1242295d2632bbd

Observation 719c4ffa-361f-4604-a5ce-d629d2676e6d · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-15T21:47:07.620033Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:47:07.620033Z digest=sha256:35bc69b38aff937ae1e9e1b452286c88e7f12c840d9e4e4898dd2480905ee8a8

Observation 6a0f1859-90db-4a62-83c0-739ebb42685c · outbound

This paper cites A Survey on In-context Learning.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation A Survey on In-context Learning

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-15T21:47:07.624728Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:47:07.624728Z digest=sha256:b3de569a11235128ad07136b1aba34f38137ca95684e5169bb7f5883f9565279

Observation 461be28f-c97b-4641-9370-7ef4f096f8d3 · outbound

This paper cites ClassEval: A Manually-Crafted Benchmark for Evaluating LLMs on Class-level Code Generation.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation ClassEval: A Manually-Crafted Benchmark for Evaluating LLMs on Class-level Code Generation

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-15T21:47:07.629346Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:47:07.629346Z digest=sha256:9b97614018c0521f6b52ac0d307aaef33380ccac0005688107aab27d38faf1b1

Observation fd1fbb5f-f044-4772-8892-8889ee8514fc · outbound

This paper cites Text-to-SQL Empowered by Large Language Models: A Benchmark Evaluation.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation Text-to-SQL Empowered by Large Language Models: A Benchmark Evaluation

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-15T21:47:07.634038Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:47:07.634038Z digest=sha256:1c1814659ff2dd1c17ace778c16468797afb5703b6095175495ae381fca4a6a1

Observation 9c5cb4a5-f725-440f-a4cf-25c7d7ffcea3 · outbound

This paper cites Instruction Following without Instruction Tuning.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation Instruction Following without Instruction Tuning

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-15T21:47:07.638694Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:47:07.638694Z digest=sha256:d1c5ea4f92f85f618b0d5f0d13250c6ea63368d0e8608cbc3bf036f9e924f3af

Observation 74e871a1-6597-4553-9e42-b263a33f2bae · outbound

This paper cites OpenCoder: The Open Cookbook for Top-Tier Code Large Language Models.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation OpenCoder: The Open Cookbook for Top-Tier Code Large Language Models

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-15T21:47:07.643347Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:47:07.643347Z digest=sha256:d7242c4b31106587b65a28857fb76b612cda78ba8ded76dbbbecc1facd288d41

Observation 87ec06e8-8f97-4d0a-ac33-31ea501dc86e · outbound

This paper cites Qwen2.5-Coder Technical Report.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation Qwen2.5-Coder Technical Report

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-15T21:47:07.648125Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:47:07.648125Z digest=sha256:90bbee60dee1983a3d5e55e2e2e2d62e1e87d649ab9ebe4eab403371edd05b9a

Observation e64c5eb5-2b86-49d0-8479-78cff52564e6 · outbound

This paper cites Code Security Vulnerability Repair Using Reinforcement Learning with Large Language Models.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation Code Security Vulnerability Repair Using Reinforcement Learning with Large Language Models

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-15T21:47:07.652728Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:47:07.652728Z digest=sha256:cea2f6f5d34322812c77cfa1e7b995af0713c14a07899ce419790f16b6690eb0

Observation d9525066-813c-4d68-9fb3-4c8eb248a001 · outbound

This paper cites LLM-Powered Code Vulnerability Repair with Reinforcement Learning and Semantic Reward.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation LLM-Powered Code Vulnerability Repair with Reinforcement Learning and Semantic Reward

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-15T21:47:07.657348Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:47:07.657348Z digest=sha256:788dfd2d3da31179ceeea9a815888905cba14f0125727d3fa2637cef623620b5

Observation defd3581-e110-4905-9dc0-8d4a0f74517c · outbound

This paper cites Coarse-Tuning Models of Code with Reinforcement Learning Feedback.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation Coarse-Tuning Models of Code with Reinforcement Learning Feedback

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-15T21:47:07.662160Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:47:07.662160Z digest=sha256:89d382df48ceb6116ff10868b6f96d6018e07cdc0140a68c671ff61360399c05

Observation c69ee599-1f0a-498a-a851-125011ea847d · outbound

This paper cites FollowBench: A Multi-level Fine-grained Constraints Following Benchmark for Large Language Models.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation FollowBench: A Multi-level Fine-grained Constraints Following Benchmark for Large Language Models

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-15T21:47:07.666667Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:47:07.666667Z digest=sha256:d4a3e46919cc7e8795a78e71f6b586bf4a03175aa5a19861ed1e92b907611466

Observation 03882f12-0034-442f-8a59-4e8313df98a2 · outbound

This paper cites E., Yang, J., Wettig, A., Yao, S., Pei, K., Press, O., and Narasimhan, K.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation E., Yang, J., Wettig, A., Yao, S., Pei, K., Press, O., and Narasimhan, K

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T21:47:08.617178Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-15T21:47:07.671054Z digest=sha256:714cdf80bd30bbf2cc34a88804876d18b44c69f082fcddc3bf695839420ad3b8

Observation 4adbef44-8446-42d9-8d7a-f93b43b868dd · outbound

This paper cites DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-15T21:47:07.675498Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:47:07.675498Z digest=sha256:650255397d5a5b0c4c68389efd3799c8d50a7e5cf16f8648545ad6babbc70fc8

Observation 915a6cd4-65f3-4ef4-a628-341ea80bc722 · outbound

This paper cites StarCoder: may the source be with you!.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation StarCoder: may the source be with you!

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-15T21:47:07.680056Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:47:07.680056Z digest=sha256:f35ed69a4cca48a771ccb22ce95434c3116c8120af203da32492f74e655b2850

Observation 9fa98f54-f811-429b-a87d-1c8a57f09ffe · outbound

This paper cites Implicit In-context Learning.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation Implicit In-context Learning

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-15T21:47:07.684338Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:47:07.684338Z digest=sha256:353a16d5d96f96fb29d0ae2db8d88830fe28b06f4769b25f1e5b45193c18d985

Observation ed84cfbb-69f1-41ea-ab58-a338c2f77e91 · outbound

This paper cites Let's Verify Step by Step.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation Let's Verify Step by Step

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-15T21:47:07.688878Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:47:07.688878Z digest=sha256:79755bcfde8c95e1372d2026d2d13793f1ed61c7e5145f435729c634e7b37475

Observation a8ea5523-8453-4789-bad1-2f6484f8211b · outbound

This paper cites F., Lin, K., Hewitt, J., Paranjape, A., Bevilacqua, M., Petroni, F., and Liang, P.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation F., Lin, K., Hewitt, J., Paranjape, A., Bevilacqua, M., Petroni, F., and Liang, P

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T21:47:08.603780Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-15T21:47:07.693330Z digest=sha256:b8edb06cdd6f61bf41f9a21b41add40714229e2f93be19f39f36f86ec0241442

Observation c97fe7e4-7e51-47c6-9df7-1b3c0cff747c · outbound

This paper cites Large Language Model Instruction Following: A Survey of Progresses and Challenges.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation Large Language Model Instruction Following: A Survey of Progresses and Challenges

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-15T21:47:07.697713Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:47:07.697713Z digest=sha256:81db1c149d78f60013dc98b9e31a0bf8467bdeda723667146221078886eb82a9

Observation d2b2882a-a8e7-4d3a-8d5b-abc2d9b55254 · outbound

This paper cites StarCoder 2 and The Stack v2: The Next Generation.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation StarCoder 2 and The Stack v2: The Next Generation

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-15T21:47:07.702234Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:47:07.702234Z digest=sha256:27f8785855531947b26785ed071f9aee0bb888cb993e08d29b1e3ba57a820364

Observation df2d2159-68ab-4370-a72f-070494b27d7b · outbound

This paper cites Test-Driven Development for Code Generation.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation Test-Driven Development for Code Generation

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-15T21:47:07.706561Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:47:07.706561Z digest=sha256:c91dd0a09945fff47a77e1c3d19ea03d6105dbcd53c6534127612c0571107ceb

Observation 271b15e7-e93d-4fdf-a334-d587f66cd78e · outbound

This paper cites React framework.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation React framework

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T21:47:08.590131Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-15T21:47:07.710906Z digest=sha256:60f8c1d04d3adcafab940a0021bd22cbb3a30e8789b9eebe314209503fd42743

Observation 3a550d67-7c0d-4c16-a61d-2ce2f3e3ca1c · outbound

This paper cites Mdn web docs.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation Mdn web docs

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T21:47:08.576363Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-15T21:47:07.715156Z digest=sha256:1012965d88cc5ceed47fea41e3c7b2b70611699df639a1152c8df10d8ffd2053

Observation 5a25c69c-92ef-484e-8d02-4068ba50ab84 · outbound

This paper cites Testing LLMs on Code Generation with Varying Levels of Prompt Specificity.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation Testing LLMs on Code Generation with Varying Levels of Prompt Specificity

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-15T21:47:07.719350Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:47:07.719350Z digest=sha256:2a623375cb84b24dd74195b840a9f35690d4c57ec77be8ca270ad4d19325123d

Observation ebb585c0-1a04-4db3-b8ec-b7f23788334e · outbound

This paper cites Introducing swe-bench verified.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation Introducing swe-bench verified

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T21:47:08.561237Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-15T21:47:07.723815Z digest=sha256:8f5688cbe243197ff9a9dabd883a9f1809952ccf13bdd9f0d1ae784398fc5a08

Observation c5ec8b29-f0af-4db3-9c5c-a70c71903b42 · outbound

This paper cites LLM4TDD: Best Practices for Test Driven Development Using Large Language Models.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation LLM4TDD: Best Practices for Test Driven Development Using Large Language Models

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-15T21:47:07.728062Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:47:07.728062Z digest=sha256:acb99178614b20045d64f835a3c33b4751b54360985461e8d6c7963eec5ab5eb

Observation cc88c425-18c2-4da5-b1dd-5dbbe5c68ea1 · outbound

This paper cites InFoBench: Evaluating Instruction Following Ability in Large Language Models.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation InFoBench: Evaluating Instruction Following Ability in Large Language Models

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-15T21:47:07.732870Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:47:07.732870Z digest=sha256:a444eea237062645fa26a9d807bdd8c3db9891ff73810a7ffea7f42e8751c90e

Observation 1d6b7c9b-327d-494d-8a9f-0cb3537a75e6 · outbound

This paper cites Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-15T21:47:07.737318Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:47:07.737318Z digest=sha256:8f8c3ee712168c45b321d80f8da87a2d4d6d14d8d679098065c629d2e8c8c91c

Observation eb5ffa12-f980-4474-b14d-ee50c8e0538a · outbound

This paper cites What needs to go right for an induction head? A mechanistic study of in-context learning circuits and their formation.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation What needs to go right for an induction head? A mechanistic study of in-context learning circuits and their formation

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-15T21:47:07.742026Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:47:07.742026Z digest=sha256:0cd84b4b8434a36cc5663a606b0b92a57f033b7d2e2fdb7f53a0b19fbc05cb6b

Observation 247971a5-568a-418d-99b1-f7ce0686afbf · outbound

This paper cites Multi-Task Inference: Can Large Language Models Follow Multiple Instructions at Once?.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation Multi-Task Inference: Can Large Language Models Follow Multiple Instructions at Once?

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-15T21:47:07.746574Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:47:07.746574Z digest=sha256:963ab2ed8eec73ec841e72908e53eb2a4f43a5fc3fd05eeacaee4a59b2914584

Observation 69f1cd5d-4d97-47f8-bf9a-4bac9cd57cc5 · outbound

This paper cites Reinforcement Learning from Automatic Feedback for High-Quality Unit Test Generation.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation Reinforcement Learning from Automatic Feedback for High-Quality Unit Test Generation

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-15T21:47:07.751262Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:47:07.751262Z digest=sha256:485ed8da0a4316dcd8e29124e7275ba90ebaa565cccc94db014d8f3210bcb452

Observation d573ca1f-aeb5-4510-b5e1-5736206e424c · outbound

This paper cites Hypothesis search: Inductive reasoning with language models.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation Hypothesis search: Inductive reasoning with language models

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T21:47:08.548163Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-15T21:47:07.755863Z digest=sha256:ce36103134a54f80e12dc058d67d93c2ae1e9ddc87cb5bdd9a6a827c30187abd

Observation 19ed2752-1f40-477b-9d16-e94153571148 · outbound

This paper cites Self-Instruct: Aligning Language Models with Self-Generated Instructions.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation Self-Instruct: Aligning Language Models with Self-Generated Instructions

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-15T21:47:07.760111Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:47:07.760111Z digest=sha256:f297385eb091ac358bc7391d7f3f610bc844977be6c61edcadb6b1855f8ca932

Observation 26dfcfc7-7d51-424f-beb6-92c6198698e4 · outbound

This paper cites Finetuned Language Models Are Zero-Shot Learners.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation Finetuned Language Models Are Zero-Shot Learners

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-15T21:47:07.764609Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:47:07.764609Z digest=sha256:9e8f44b08c073926a548f2dd042f30bfe941ec8e013a688c2ad257e414c37aa6

Observation 1636f878-e7bc-42ae-b828-47a5a3305420 · outbound

This paper cites An Explanation of In-context Learning as Implicit Bayesian Inference.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation An Explanation of In-context Learning as Implicit Bayesian Inference

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-15T21:47:07.769478Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:47:07.769478Z digest=sha256:d86600a3bcf7080157090e941882bcf2c90bbbb5f95eed9a56b3c0c3909c5039

Observation 0a8ee398-e969-410e-a2c8-3c5ff1b3792f · outbound

This paper cites C.-J., Zhang, T., Patil, S.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation C.-J., Zhang, T., Patil, S

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T21:47:08.534301Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-15T21:47:07.774453Z digest=sha256:80eaa6c50f33e27301097abd318473a0d3d996ed4bfb13e7aeee60af01c6b0d7

Observation a124e88e-1682-4684-a24d-b62c2944c9b1 · outbound

This paper cites Codereval: A benchmark of pragmatic code generation with generative pre-trained models, 2023.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation Codereval: A benchmark of pragmatic code generation with generative pre-trained models, 2023

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T21:47:08.520633Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-15T21:47:07.779593Z digest=sha256:b5050ca92da211ab4a549d48d62833e69cb27b6535132e17ebb2f29aa403549a

Observation e55de092-178a-497a-9eb0-142bbdfa4e10 · outbound

This paper cites an unresolved cited work.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation Unresolved cited work

Reference 46

Resolution
unresolved
raw_fallback, observed 2026-08-15T21:47:08.505637Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-15T21:47:07.784588Z digest=sha256:40e801d56925454bb249f6ec6297e74f25fe18604d483879c98c2d33fc352a93

Observation 15bc3cae-9ad1-4898-a751-1b50d544cbeb · outbound

This paper cites Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-15T21:47:07.788740Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:47:07.788740Z digest=sha256:f170b76c98cd4f3ff472f101c30dbce918722eae6913d0590054d4daceafa271

Observation b29a5d1f-77b3-4244-9464-5dc0aa06eeb8 · outbound

This paper cites A survey on self-play methods in reinforcement learning, 2024.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation A survey on self-play methods in reinforcement learning, 2024

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-15T21:47:07.793104Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:47:07.793104Z digest=sha256:d7ebf510c6c730f89bb46070abff60ac104c20f13085caa3b05fc483c9300255

Observation 4d27b172-205f-4406-bbb0-0f5b22181f5a · outbound

This paper cites write newline.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation write newline

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-15T21:47:07.798142Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:47:07.798142Z digest=sha256:15ab2cb1de6490fe6856ec506f99e0bfbbf4b2127d4b72e61c378685c202ee9c

Observation 234bdd77-f35f-4f1d-ac78-5dfb1b12e841 · outbound

This paper cites @esa (Ref.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation @esa (Ref

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-15T21:47:07.804378Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:47:07.804378Z digest=sha256:003568100a9eb70d3b2c9d9b45f071df6fe5ab18d69274deb3caffd51b3d3489

Observation 906089b1-26ce-4101-9caa-fd1507ce5f58 · outbound

This paper cites an unresolved cited work.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation Unresolved cited work

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-15T21:47:07.809539Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:47:07.809539Z digest=sha256:34193a5d05b3841fd7463bd68248768f947d2799c7b9b5746a4da949777b1aae

Observation 009752c6-dfa6-4d46-8b19-e93ff9b46d5e · outbound

This paper cites an unresolved cited work.

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation Unresolved cited work

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-15T21:47:07.814079Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:47:07.814079Z digest=sha256:669cbc36f09cef9249819a30407a6107169342d5067d9e0768cf5f1338bdbe85

Pith citing papers

Observation f9739363-1866-4844-9794-a79322847282 · inbound

Vibe Coding vs. Agentic Coding: Fundamentals and Practical Implications of Agentic AI cites this paper.

Vibe Coding vs. Agentic Coding: Fundamentals and Practical Implications of Agentic AI Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation

Reference 191

Resolution
unresolved
no resolver link, observed 2026-08-07T14:15:49.870701Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:15:49.870701Z digest=sha256:1b0762f2056b489c9187c44b6fdfca43bcba432098d88cdc4897a23cfab1d95f

Observation 9a7f6292-c31c-4d4b-a303-b8ef39fabb6b · inbound

TDD Governance for Multi-Agent Code Generation via Prompt Engineering cites this paper.

TDD Governance for Multi-Agent Code Generation via Prompt Engineering Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation

Reference 3

Resolution
verified exact
arxiv_id, observed 2026-05-12T09:16:26.986082Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-07T11:40:59.915105Z digest=sha256:da32930f4b31fe1268f7678e177b6ea862f1623bd9bdc9ac4c736bd49f78329c

Observation 599f82cd-22cb-4a15-ae19-d5bf46f4818e · inbound

TICoder: A Repository-Level Code Generation Framework with Test-Driven Planning and Implementation-Aware Reuse cites this paper.

TICoder: A Repository-Level Code Generation Framework with Test-Driven Planning and Implementation-Aware Reuse Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation

Reference 7

Resolution
verified exact
arxiv_id, observed 2026-07-02T21:47:27.671119Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-06-27T19:33:55.542004Z digest=sha256:c96c5b907a8d760901e2933b0299a25ecdf465edaea5571debee8b78eefc68e4