Pith. sign in

Paper Citation Record · LEDGER

ProgramBench: Can Language Models Rebuild Programs From Scratch?

As of 12 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 26 inbound Pith citation observations for arXiv:2605.03546.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2605.03546 v1

Coverage vector

measured 21 of 21 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-05-07T16:02:16.598404Z

measured 47 of 47 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-12T06:34:41.77262+00:00

measured 26 of 26 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-12T00:12:42.031152Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-08-05T02:28:24.338817Z

Reference resolution

21 of 21 outbound references displayed

  • verified exact11
  • verified fuzzy2
  • unresolved1
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch7

External citation measurements

73
pith, observed 2026-08-05T02:28:24.338817Z

Outbound references

Observation 23491487-6b18-45e6-a9a2-a55a076fc98e · outbound

This paper cites SWE-rebench: An Automated Pipeline for Task Collection and Decontaminated Evaluation of Software Engineering Agents.

ProgramBench: Can Language Models Rebuild Programs From Scratch? SWE-rebench: An Automated Pipeline for Task Collection and Decontaminated Evaluation of Software Engineering Agents

Reference 1

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T23:56:13.353420Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-07T16:02:16.598404Z digest=sha256:4a6fcbced887e6ee0a91dd9fd7d69d418000625fadb23785ea0c842b06c0e677

Observation 2732c2d3-dbcb-43b6-8b21-67d4a240221f · outbound

This paper cites SWE-chat: Coding Agent Interactions From Real Users in the Wild.

ProgramBench: Can Language Models Rebuild Programs From Scratch? SWE-chat: Coding Agent Interactions From Real Users in the Wild

Reference 2

Resolution
verified exact
local_arxiv, observed 2026-05-11T23:56:13.347393Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-07T16:02:16.598404Z digest=sha256:71aa1609ef6b15fd9b50684533bb793a6e4af5468228484f6817d49004114dd1

Observation c658db2a-4b2d-408f-ad8c-9d960b5f59cb · outbound

This paper cites Agentless: Demystifying LLM-based Software Engineering Agents.

ProgramBench: Can Language Models Rebuild Programs From Scratch? Agentless: Demystifying LLM-based Software Engineering Agents

Reference 3

Resolution
metadata mismatch
arxiv_id, observed 2026-05-12T05:12:23.134333Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-07T16:02:16.598404Z digest=sha256:872626907eccb5f899205e280b2f246be2abe57e3fcd04ffe8b0c695a85c2a07

Observation 3ebf38f3-0b04-491a-b912-460c64803631 · outbound

This paper cites SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?.

ProgramBench: Can Language Models Rebuild Programs From Scratch? SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?

Reference 4

Resolution
verified exact
arxiv_id, observed 2026-05-12T13:48:53.849224Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-07T16:02:16.598404Z digest=sha256:df145109059eabd6fef8ed6e2ca1f566d19bc8bfdda64e37c1edec4b0fa6af29

Observation da61c64a-fd80-4b54-b3b4-14ed41c5919d · outbound

This paper cites Effective Strategies for Asynchronous Software Engineering Agents.

ProgramBench: Can Language Models Rebuild Programs From Scratch? Effective Strategies for Asynchronous Software Engineering Agents

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-07-09T02:20:28.718424Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-07T16:02:16.598404Z digest=sha256:cebfe4371256f4e772fbeef77f7741ddf58382830b5c404a6ceaef978793b3ed

Observation 5d2872e8-76fe-4b6e-ab67-5d80d71f2491 · outbound

This paper cites Measuring Coding Challenge Competence With APPS.

ProgramBench: Can Language Models Rebuild Programs From Scratch? Measuring Coding Challenge Competence With APPS

Reference 6

Resolution
metadata mismatch
local_arxiv, observed 2026-05-11T23:56:13.394504Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-07T16:02:16.598404Z digest=sha256:285902dac79ff65416239a55af2f6dcb58c4ff6b9415d22573c8b6eddb0ddd2a

Observation 3f2c7c33-e23f-4fa7-b197-dbbfec9f3567 · outbound

This paper cites EffiBench: Benchmarking the Efficiency of Automatically Generated Code.

ProgramBench: Can Language Models Rebuild Programs From Scratch? EffiBench: Benchmarking the Efficiency of Automatically Generated Code

Reference 7

Resolution
verified exact
arxiv_id, observed 2026-05-11T23:56:13.388652Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-07T16:02:16.598404Z digest=sha256:f8cf7bb6049d3bc4e8680b7ef2aba558bc3a4bd98122c6a2ccdb3ef9de107488

Observation b5dc6ee8-1492-41db-b8e1-c2609ac3cc8b · outbound

This paper cites SWE-bench: Can Language Models Resolve Real-World GitHub Issues?.

ProgramBench: Can Language Models Rebuild Programs From Scratch? SWE-bench: Can Language Models Resolve Real-World GitHub Issues?

Reference 8

Resolution
metadata mismatch
local_arxiv, observed 2026-05-11T23:56:13.327585Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-07T16:02:16.598404Z digest=sha256:bbed97353240ce4637f9fc22d59762d38968134864e7e6ec3528491fa06c9e65

Observation 74e1376c-a74e-4f76-b723-c28bd2414375 · outbound

This paper cites doi: 10.1109/TSE.2015.2454513.https://doi.org/10.

ProgramBench: Can Language Models Rebuild Programs From Scratch? doi: 10.1109/TSE.2015.2454513.https://doi.org/10

Reference 9

Resolution
verified exact
arxiv_id, observed 2026-05-09T02:04:38.417879Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-07T16:02:16.598404Z digest=sha256:0f52f00e6a52242ad54022ef37dc22ba77de98a61e702b246871ef5562d8d5bd

Observation 32612799-a066-49b0-b250-2d8d92b0940e · outbound

This paper cites Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation.

ProgramBench: Can Language Models Rebuild Programs From Scratch? Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 10

Resolution
metadata mismatch
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-07T16:02:16.598404Z digest=sha256:466331a74654bcf748f9691c756610a70701f346d37ac7f879ebe2c9e5481050

Observation 3ee170c3-ed9c-4fd4-be20-f3831f7bf6f3 · outbound

This paper cites KernelBench: Can LLMs Write Efficient GPU Kernels?.

ProgramBench: Can Language Models Rebuild Programs From Scratch? KernelBench: Can LLMs Write Efficient GPU Kernels?

Reference 11

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T16:55:02.220088Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-07T16:02:16.598404Z digest=sha256:b75ae9a5704ae51cdf46778cce2aa7e73f6339d2fe06ed91ff00009e503aa41a

Observation 3ebec05b-a78d-4660-b4c0-8907d37d49a4 · outbound

This paper cites K., Krupke, D., Kidger, P., Sajed, T., Stellato, B., Park, J., et al.

ProgramBench: Can Language Models Rebuild Programs From Scratch? K., Krupke, D., Kidger, P., Sajed, T., Stellato, B., Park, J., et al

Reference 12

Resolution
verified exact
arxiv_id, observed 2026-05-11T23:56:13.411871Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-07T16:02:16.598404Z digest=sha256:8aaff71dc79c11d3dc71da9be2a3938f2f660ead5074cd8e987e83cb66389626

Observation 06e4e3f1-2dae-412d-960e-490812c3f472 · outbound

This paper cites 14 Manish Shetty, Naman Jain, Jinjian Liu, Vijay Kethanaboyina, Koushik Sen, and Ion Stoica.

ProgramBench: Can Language Models Rebuild Programs From Scratch? 14 Manish Shetty, Naman Jain, Jinjian Liu, Vijay Kethanaboyina, Koushik Sen, and Ion Stoica

Reference 13

Resolution
verified exact
arxiv_id, observed 2026-05-11T23:56:13.361717Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-07T16:02:16.598404Z digest=sha256:64ac385fef279cb9d7a1487c2ec56c8945cb2b0374a211488a58789508556249

Observation 9b74c08e-5aca-4489-9732-84c2bc29875e · outbound

This paper cites SWE-EVO: Benchmarking Coding Agents in Long-Horizon Software Evolution Scenarios.

ProgramBench: Can Language Models Rebuild Programs From Scratch? SWE-EVO: Benchmarking Coding Agents in Long-Horizon Software Evolution Scenarios

Reference 14

Resolution
verified exact
local_arxiv, observed 2026-05-11T23:56:13.321829Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-07T16:02:16.598404Z digest=sha256:35aee310c10d37cd0d1a8785ebe98a44ff1b2ff246008b8faf00c4fc0ae92014

Observation 96b3cbc3-d577-4412-87c4-f28dba077f05 · outbound

This paper cites ECCO: Can We Improve Model-Generated Code Efficiency Without Sacrificing Functional Correctness?.

ProgramBench: Can Language Models Rebuild Programs From Scratch? ECCO: Can We Improve Model-Generated Code Efficiency Without Sacrificing Functional Correctness?

Reference 15

Resolution
verified exact
arxiv_id, observed 2026-05-11T23:56:13.333810Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-07T16:02:16.598404Z digest=sha256:5acb99d2a93c9103ef24ed9d545ed5456fb5d241a299038eefdd9af7e139aeda

Observation 521c5a30-4917-4235-8906-c77e34d7aa29 · outbound

This paper cites CodeARC: Benchmarking Reasoning Capabilities of LLM Agents for Inductive Program Synthesis.

ProgramBench: Can Language Models Rebuild Programs From Scratch? CodeARC: Benchmarking Reasoning Capabilities of LLM Agents for Inductive Program Synthesis

Reference 16

Resolution
verified exact
arxiv_id, observed 2026-05-11T23:56:13.383861Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-07T16:02:16.598404Z digest=sha256:7c220dd822de59a388d99d4e160ffc1e9fd085701e2b2857bfb467974b5099a0

Observation bf80bdb8-7412-4e37-9977-190650dea79a · outbound

This paper cites SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering.

ProgramBench: Can Language Models Rebuild Programs From Scratch? SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering

Reference 17

Resolution
metadata mismatch
local_arxiv, observed 2026-05-11T23:56:13.309437Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-07T16:02:16.598404Z digest=sha256:741f8b1e11e1f6691950f51203890af7a89f631228c49e12ddd86917f87d2ee5

Observation aa33546a-0a4e-435e-888e-ddbcc12cc5e6 · outbound

This paper cites SWE-smith: Scaling Data for Software Engineering Agents.

ProgramBench: Can Language Models Rebuild Programs From Scratch? SWE-smith: Scaling Data for Software Engineering Agents

Reference 18

Resolution
verified exact
arxiv_id, observed 2026-05-15T10:22:07.061654Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-07T16:02:16.598404Z digest=sha256:232ae98577da6406f08d96f45f1be06c1317974572568be35cb12facf7787690

Observation 8c3fc952-9b6d-4c25-a771-e3cc3a85fb49 · outbound

This paper cites an unresolved cited work.

ProgramBench: Can Language Models Rebuild Programs From Scratch? Unresolved cited work

Reference 19

Resolution
unresolved
raw_fallback, observed 2026-05-27T02:38:42.966033Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-07T16:02:16.598404Z digest=sha256:a7013c9dcaa9eeda6ece70bc89a5fc7e8f5a03bd8bd190bb477a39d9ce980c9e

Observation 1e3bf5a8-11fb-41de-816a-6d8e5049f672 · outbound

This paper cites blocklist.

ProgramBench: Can Language Models Rebuild Programs From Scratch? blocklist

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-05-27T02:38:42.968572Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-07T16:02:16.598404Z digest=sha256:f62389cbb07ad0759b8835133890d6e8c0643e90e3ef977657d10a8225093d7f

Observation a1e91875-76e0-439e-9b01-84a3f117e77d · outbound

This paper cites Dependency count.Of the 200 repositories, 171 (85.5%) contain a recognized package manifest file; among these, the median repository declares 17 total dependencies (12 runtime).

ProgramBench: Can Language Models Rebuild Programs From Scratch? Dependency count.Of the 200 repositories, 171 (85.5%) contain a recognized package manifest file; among these, the median repository declares 17 total dependencies (12 runtime)

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-05-27T02:38:42.971660Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-07T16:02:16.598404Z digest=sha256:9a34b3b8bdfac980dfcfc44c873428d75b537ba9f6640ce5d1a405490ddc7a96

Pith citing papers

Observation cb4518c9-e379-45d2-b783-58f0f704ad54 · inbound

SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks? cites this paper.

SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks? ProgramBench: Can Language Models Rebuild Programs From Scratch?

Reference 20

Resolution
metadata mismatch
local_arxiv, observed 2026-06-29T17:33:44.659958Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-07-11T11:50:26.030339Z digest=sha256:615617829cf05460eb7fcada217ac2191b56a0496bc4ac0a46c8ee1033902d32

Observation 8877253a-ba49-450b-be39-ee7688061346 · inbound

SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks? cites this paper.

SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks? ProgramBench: Can Language Models Rebuild Programs From Scratch?

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-02T13:10:41.424053Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T13:10:41.424053Z digest=sha256:48ee57befd84e560396398a70f0e2e6f26609a60ea7293bf280cbcf4cedf1264

Observation 9aea32eb-cab9-4419-8c73-3f45ced95e0a · inbound

Benchmarks are Not Enough: RAMP for Runtime Assessing of Agentic Models in Production Systems cites this paper.

Benchmarks are Not Enough: RAMP for Runtime Assessing of Agentic Models in Production Systems ProgramBench: Can Language Models Rebuild Programs From Scratch?

Reference 30

Resolution
verified exact
local_arxiv, observed 2026-06-29T15:33:32.796096Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-29T15:32:21.737028Z digest=sha256:25dc0f9a18242b338ea8790337068892e308c32b5dc75ab0d6ab8eef23417c22

Observation 01073e1b-ede1-4856-ac7f-9a4a6c3f8804 · inbound

An Enigma of Artificial Reason: Investigating the Production-Evaluation Gap in Large Reasoning Models cites this paper.

An Enigma of Artificial Reason: Investigating the Production-Evaluation Gap in Large Reasoning Models ProgramBench: Can Language Models Rebuild Programs From Scratch?

Reference 59

Resolution
verified exact
local_arxiv, observed 2026-07-01T21:36:14.982013Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-28T16:45:33.046568Z digest=sha256:a94c753fa17e9b27437090fcb4df6034eb79e1b81a2971183bed49e2a4a55c49

Observation 444b9378-2a23-4aac-8961-0bc25fd993cf · inbound

Position: Coding Benchmarks Are Misaligned with Agentic Software Engineering cites this paper.

Position: Coding Benchmarks Are Misaligned with Agentic Software Engineering ProgramBench: Can Language Models Rebuild Programs From Scratch?

Reference 51

Resolution
verified exact
local_arxiv, observed 2026-07-03T22:08:58.899375Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-26T23:48:58.497927Z digest=sha256:ebfbb85edb035a92815aea62bd3415148ca624a605530b953f319fc49d99b27e

Observation 562e2e17-d6bf-42d4-9af3-7f3aa429ca7d · inbound

Position: Coding Benchmarks Are Misaligned with Agentic Software Engineering cites this paper.

Position: Coding Benchmarks Are Misaligned with Agentic Software Engineering ProgramBench: Can Language Models Rebuild Programs From Scratch?

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-02T11:06:04.025951Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T11:06:04.025951Z digest=sha256:11da42faa84c22b3d805a9116e105cab5c94e99b67ec3b0f6d6db627b1f0d112

Observation 2385a71b-7635-43c1-8e9c-3787a865c67f · inbound

ORAgentBench: Can LLM Agents Solve Challenging Operations Research Tasks End to End? cites this paper.

ORAgentBench: Can LLM Agents Solve Challenging Operations Research Tasks End to End? ProgramBench: Can Language Models Rebuild Programs From Scratch?

Reference 2

Resolution
malformed identifier
local_arxiv, observed 2026-07-04T03:49:31.270978Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-26T17:31:49.754183Z digest=sha256:592659dead8f267ca4b44a2407638811452045b116d12be5db294e9f131d3522

Observation f9b5b92d-69a0-4255-a079-67aa72182e16 · inbound

PhoneBuddy: Training Open Models for Agentic Phone Use cites this paper.

PhoneBuddy: Training Open Models for Agentic Phone Use ProgramBench: Can Language Models Rebuild Programs From Scratch?

Reference 66

Resolution
metadata mismatch
local_arxiv, observed 2026-07-04T10:59:46.417569Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-06-26T08:15:49.428124Z digest=sha256:b77bf530fc1248a0fd9f8e342f055e3880ce21cb155a36433e2229f8eeb5dae9

Observation 7cb494e5-ef3d-49d3-82d3-6e13fd75130f · inbound

OSWorld 2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks cites this paper.

OSWorld 2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks ProgramBench: Can Language Models Rebuild Programs From Scratch?

Reference 101

Resolution
verified exact
local_arxiv, observed 2026-06-30T07:14:21.230453Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-30T07:10:38.909339Z digest=sha256:54aefb754b93f28447b35ba127a883c755cbc13b6a49862ab697534fa5e8bb07

Observation b24001df-3fae-46eb-8a3e-42837d9dabad · inbound

OSWorld 2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks cites this paper.

OSWorld 2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks ProgramBench: Can Language Models Rebuild Programs From Scratch?

Reference 101

Resolution
unresolved
no resolver link, observed 2026-07-15T10:24:53.345620Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-15T10:24:53.345620Z digest=sha256:37de1029555f4fb9321c5bc941a6cb1f77e136a293c72190e9bcde1de2ec022d

Observation 42ab37f4-185c-4fcb-ade7-06407dd454bf · inbound

MirrorCode: AI can rebuild entire programs from behavior alone cites this paper.

MirrorCode: AI can rebuild entire programs from behavior alone ProgramBench: Can Language Models Rebuild Programs From Scratch?

Reference 11

Resolution
verified exact
local_arxiv, observed 2026-06-30T06:44:19.675236Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-30T06:35:32.667865Z digest=sha256:5a83c6d2b7fc8d9a1139b5c266935b94bcfae3a96df107f617ebdbce9b8b18ec

Observation b417fda7-9a20-4bd3-8b91-112047e66d5a · inbound

MirrorCode: AI can rebuild entire programs from behavior alone cites this paper.

MirrorCode: AI can rebuild entire programs from behavior alone ProgramBench: Can Language Models Rebuild Programs From Scratch?

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-02T09:35:02.002201Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T09:35:02.002201Z digest=sha256:2744a95730957d7bd87b4cb415e53e493da148ce41adbe629fb0e7fd27e38368

Observation 80ecb84a-28a8-4e1e-b014-8024f51ce7ee · inbound

Cheap Code, Costly Judgment: A Case Study on Governable Agentic Software Engineering cites this paper.

Cheap Code, Costly Judgment: A Case Study on Governable Agentic Software Engineering ProgramBench: Can Language Models Rebuild Programs From Scratch?

Reference 23

Resolution
metadata mismatch
local_arxiv, observed 2026-07-02T08:16:47.197371Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-07-02T08:14:31.379786Z digest=sha256:40afd50ebed5dae83156f06d4c7f0a5f8d1af2a71793e6dd02127dbe1a28c17f

Observation 3e2e693c-94df-46e4-a847-871633a1880f · inbound

Cheap Code, Costly Judgment: A Case Study on Governable Agentic Software Engineering cites this paper.

Cheap Code, Costly Judgment: A Case Study on Governable Agentic Software Engineering ProgramBench: Can Language Models Rebuild Programs From Scratch?

Reference 23

Resolution
unresolved
no resolver link, observed 2026-07-12T09:00:11.864155Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:00:11.864155Z digest=sha256:684f245dbb8625411c1f6ba382ef6c3a5c04949fd1791d11f7e5d634f0ba86a2

Observation 7dd1e738-f856-47c2-9f7a-0a8fbf2aeef7 · inbound

ChainSWE: Benchmarking Coding Agents on Multi-Bug Software Maintenance cites this paper.

ChainSWE: Benchmarking Coding Agents on Multi-Bug Software Maintenance ProgramBench: Can Language Models Rebuild Programs From Scratch?

Reference 5

Resolution
unresolved
no resolver link, observed 2026-07-12T09:10:20.997349Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:10:20.997349Z digest=sha256:baeaedb6c16fe9d826a96cd965ef607c3392f94a52c36c554676698d7dbffbeb

Observation 02d33732-dc73-463e-8f34-8923d7b0426f · inbound

GameEngineBench: Evaluating Coding Agents on Real C++ Runtime Environments cites this paper.

GameEngineBench: Evaluating Coding Agents on Real C++ Runtime Environments ProgramBench: Can Language Models Rebuild Programs From Scratch?

Reference 17

Resolution
unresolved
no resolver link, observed 2026-07-12T01:53:29.099211Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T01:53:29.099211Z digest=sha256:cd67ff04386af2be91b6d2999d1c13e8c504870e9ad819d934995fc8732b9424

Observation 9a3b249d-c456-4308-b02c-24b056bc14a8 · inbound

GameEngineBench: Evaluating Coding Agents on Real C++ Runtime Environments cites this paper.

GameEngineBench: Evaluating Coding Agents on Real C++ Runtime Environments ProgramBench: Can Language Models Rebuild Programs From Scratch?

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-02T08:52:20.760608Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:52:20.760608Z digest=sha256:b96487810bd28b90d92e4ab07484bf461b6427a9168ef14f96a6289cbff3efc5

Observation f8663cfd-75fb-42d0-8bda-d2b42f5110ea · inbound

ArchEval: Measuring AI Agents as Computer Architects cites this paper.

ArchEval: Measuring AI Agents as Computer Architects ProgramBench: Can Language Models Rebuild Programs From Scratch?

Reference 52

Resolution
unresolved
no resolver link, observed 2026-07-12T01:16:50.927415Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T01:16:50.927415Z digest=sha256:2f5f2c77e2610c9fb273af3db683b2c5c4cf1ca877e4e255582fa6aedfc34f01

Observation 83dd5da8-a8d8-400f-84f0-19ca19df90eb · inbound

EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments cites this paper.

EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments ProgramBench: Can Language Models Rebuild Programs From Scratch?

Reference 77

Resolution
unresolved
no resolver link, observed 2026-07-11T07:57:43.000834Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:57:43.000834Z digest=sha256:4529d2ec46e177c91b7e91c1f98a43688111e126db68e153f02c1440dbd4037f

Observation 6c0e8a81-bdd9-415e-8be6-07d311a8254b · inbound

Large Language Models Have Unreliable Understanding of Software Engineering Terminology cites this paper.

Large Language Models Have Unreliable Understanding of Software Engineering Terminology ProgramBench: Can Language Models Rebuild Programs From Scratch?

Reference 21

Resolution
verified exact
local_arxiv, observed 2026-07-08T20:25:37.277594Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-07-08T20:22:54.983733Z digest=sha256:af8746e07c4d23ff23fd68738b4eca5cdaf242b71bef8c00344c3efaf497787e

Observation b83b7f6f-68a8-4d7d-afd2-bda795aafdd3 · inbound

PerfAgent: Profiler-Guided Iterative Refinement for Repository-Level Code Optimization cites this paper.

PerfAgent: Profiler-Guided Iterative Refinement for Repository-Level Code Optimization ProgramBench: Can Language Models Rebuild Programs From Scratch?

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-01T12:13:01.189446Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T12:13:01.189446Z digest=sha256:9e7b70a590266b49ac4237108507cfac42ade33437ad41bcb99b7fbaa7a17ca1

Observation f92f42de-b44c-4560-8ff4-913c39d620e5 · inbound

ICAE-Bench: Evaluating Coding Agents as Interactive Project Builders cites this paper.

ICAE-Bench: Evaluating Coding Agents as Interactive Project Builders ProgramBench: Can Language Models Rebuild Programs From Scratch?

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-01T08:11:24.237538Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T08:11:24.237538Z digest=sha256:0e9c762f34811ab8cee59ef1532d93d564b01f14afb6243c38d889ca8f359cbe

Observation d57c807f-6848-47f9-9cee-72b0b565b2f6 · inbound

MindForge: Teaching Small Language Models Whole-Life-Cycle Software Engineering via Source-Free Program Synthesis cites this paper.

MindForge: Teaching Small Language Models Whole-Life-Cycle Software Engineering via Source-Free Program Synthesis ProgramBench: Can Language Models Rebuild Programs From Scratch?

Reference 38

Resolution
unresolved
no resolver link, observed 2026-07-30T12:11:34.990083Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T12:11:34.990083Z digest=sha256:07f7e6f93f717b60f44fa9971c4c0eb35fc4f168be4cd35b0dbd73f70f89dafd

Observation 793a67f3-9468-431b-9c3c-d506b09ad2d2 · inbound

SpecFirst: Behavioral Specification Elicitation as a First-Class Step in Agent-Based Program Synthesis from Scratch cites this paper.

SpecFirst: Behavioral Specification Elicitation as a First-Class Step in Agent-Based Program Synthesis from Scratch ProgramBench: Can Language Models Rebuild Programs From Scratch?

Reference 5

Resolution
unresolved
no resolver link, observed 2026-07-30T11:04:45.702386Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T11:04:45.702386Z digest=sha256:5de7ff4433aee510b9c63e33e175d0e6486a980542e74ee012465dd35f638c5c

Observation 3fbf6837-852b-425b-9cb2-ebdd3652d86a · inbound

SWE-NFI: Studying and Benchmarking Coding Agents for Non-Functional Improvements cites this paper.

SWE-NFI: Studying and Benchmarking Coding Agents for Non-Functional Improvements ProgramBench: Can Language Models Rebuild Programs From Scratch?

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-01T07:55:25.392621Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T07:55:25.392621Z digest=sha256:4789baea0fc7c8bf8216b304a46aa3b8a2cc3393c75910952b2e10755cc0ce96

Observation 7dd783a3-029e-4a27-9fc8-711f071249e1 · inbound

Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution cites this paper.

Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution ProgramBench: Can Language Models Rebuild Programs From Scratch?

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-12T00:12:42.031152Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T00:12:42.031152Z digest=sha256:8540f2f9fdb64e3e133f0effaa4936a80ebd199f8616ecc576850e72d9428d42