{"as_of":"2026-08-13T00:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d313e9a894fe8c0fb113b2dc09ff72e75101d24bb606dd31e2e75a0e639c5e6f","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-07T16:02:16.598404Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":26,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:12:42.031152Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":73,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"cited_work":{"arxiv_id":"2605.03546","doi":"10.1007/978-3-319-11379-1_11","metadata_source":"pith","pith_arxiv_id":"2605.03546","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","venue":"cs.SE","work_id":"2f50598d-e729-46df-95a6-6694ddaca62d","year":2026},"citing_paper":{"arxiv_id":"2605.26548","last_updated":"2026-07-20T16:24:12Z","snapshot_observed_at":"2026-08-12T04:25:35.881558Z","submitted_at":"2026-05-26T04:59:49Z","title":"SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2605.03546","citing_paper":"/paper/2605.26548"},"observation_digest":"sha256:615617829cf05460eb7fcada217ac2191b56a0496bc4ac0a46c8ee1033902d32","observation_id":"cb4518c9-e379-45d2-b783-58f0f704ad54","resolution":{"observed_at":"2026-06-29T17:33:44.659958Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.03546","snapshot_observed_at":"2026-08-02T13:10:41.424053Z","title":"URL https://doi.org/ 10.1007/978-3-319-11379-1_11","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26548","last_updated":"2026-07-20T16:24:12Z","snapshot_observed_at":"2026-08-12T04:25:35.881558Z","submitted_at":"2026-05-26T04:59:49Z","title":"SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T13:10:41.424053Z"},"links":{"cited_paper":"/paper/2605.03546","citing_paper":"/paper/2605.26548"},"observation_digest":"sha256:48ee57befd84e560396398a70f0e2e6f26609a60ea7293bf280cbcf4cedf1264","observation_id":"8877253a-ba49-450b-be39-ee7688061346","resolution":{"observed_at":"2026-08-02T13:10:41.424053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"cited_work":{"arxiv_id":"2605.03546","doi":"10.1007/978-3-319-11379-1_11","metadata_source":"pith","pith_arxiv_id":"2605.03546","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","venue":"cs.SE","work_id":"2f50598d-e729-46df-95a6-6694ddaca62d","year":2026},"citing_paper":{"arxiv_id":"2605.27492","last_updated":"2026-05-26T16:28:10Z","snapshot_observed_at":"2026-08-07T15:27:01.984383Z","submitted_at":"2026-05-26T16:28:10Z","title":"Benchmarks are Not Enough: RAMP for Runtime Assessing of Agentic Models in Production Systems","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T15:32:21.737028Z"},"links":{"cited_paper":"/paper/2605.03546","citing_paper":"/paper/2605.27492"},"observation_digest":"sha256:25dc0f9a18242b338ea8790337068892e308c32b5dc75ab0d6ab8eef23417c22","observation_id":"9aea32eb-cab9-4419-8c73-3f45ced95e0a","resolution":{"observed_at":"2026-06-29T15:33:32.796096Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"cited_work":{"arxiv_id":"2605.03546","doi":"10.1007/978-3-319-11379-1_11","metadata_source":"pith","pith_arxiv_id":"2605.03546","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","venue":"cs.SE","work_id":"2f50598d-e729-46df-95a6-6694ddaca62d","year":2026},"citing_paper":{"arxiv_id":"2606.01462","last_updated":"2026-05-31T21:46:52Z","snapshot_observed_at":"2026-07-06T23:42:02.762832Z","submitted_at":"2026-05-31T21:46:52Z","title":"An Enigma of Artificial Reason: Investigating the Production-Evaluation Gap in Large Reasoning Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-28T16:45:33.046568Z"},"links":{"cited_paper":"/paper/2605.03546","citing_paper":"/paper/2606.01462"},"observation_digest":"sha256:a94c753fa17e9b27437090fcb4df6034eb79e1b81a2971183bed49e2a4a55c49","observation_id":"01073e1b-ede1-4856-ac7f-9a4a6c3f8804","resolution":{"observed_at":"2026-07-01T21:36:14.982013Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"cited_work":{"arxiv_id":"2605.03546","doi":"10.1007/978-3-319-11379-1_11","metadata_source":"pith","pith_arxiv_id":"2605.03546","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","venue":"cs.SE","work_id":"2f50598d-e729-46df-95a6-6694ddaca62d","year":2026},"citing_paper":{"arxiv_id":"2606.17799","last_updated":"2026-07-18T22:14:13Z","snapshot_observed_at":"2026-08-02T11:05:59.500924Z","submitted_at":"2026-06-16T11:21:01Z","title":"Position: Coding Benchmarks Are Misaligned with Agentic Software Engineering","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-26T23:48:58.497927Z"},"links":{"cited_paper":"/paper/2605.03546","citing_paper":"/paper/2606.17799"},"observation_digest":"sha256:ebfbb85edb035a92815aea62bd3415148ca624a605530b953f319fc49d99b27e","observation_id":"444b9378-2a23-4aac-8961-0bc25fd993cf","resolution":{"observed_at":"2026-07-03T22:08:58.899375Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.03546","snapshot_observed_at":"2026-08-02T11:06:04.025951Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.17799","last_updated":"2026-07-18T22:14:13Z","snapshot_observed_at":"2026-08-02T11:05:59.500924Z","submitted_at":"2026-06-16T11:21:01Z","title":"Position: Coding Benchmarks Are Misaligned with Agentic Software Engineering","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T11:06:04.025951Z"},"links":{"cited_paper":"/paper/2605.03546","citing_paper":"/paper/2606.17799"},"observation_digest":"sha256:11da42faa84c22b3d805a9116e105cab5c94e99b67ec3b0f6d6db627b1f0d112","observation_id":"562e2e17-d6bf-42d4-9af3-7f3aa429ca7d","resolution":{"observed_at":"2026-08-02T11:06:04.025951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"cited_work":{"arxiv_id":"2605.03546","doi":"10.1007/978-3-319-11379-1_11","metadata_source":"pith","pith_arxiv_id":"2605.03546","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","venue":"cs.SE","work_id":"2f50598d-e729-46df-95a6-6694ddaca62d","year":2026},"citing_paper":{"arxiv_id":"2606.19787","last_updated":"2026-06-18T04:43:23Z","snapshot_observed_at":"2026-08-07T10:39:28.966198Z","submitted_at":"2026-06-18T04:43:23Z","title":"ORAgentBench: Can LLM Agents Solve Challenging Operations Research Tasks End to End?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T17:31:49.754183Z"},"links":{"cited_paper":"/paper/2605.03546","citing_paper":"/paper/2606.19787"},"observation_digest":"sha256:592659dead8f267ca4b44a2407638811452045b116d12be5db294e9f131d3522","observation_id":"2385a71b-7635-43c1-8e9c-3787a865c67f","resolution":{"observed_at":"2026-07-04T03:49:31.270978Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"cited_work":{"arxiv_id":"2605.03546","doi":"10.1007/978-3-319-11379-1_11","metadata_source":"pith","pith_arxiv_id":"2605.03546","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","venue":"cs.SE","work_id":"2f50598d-e729-46df-95a6-6694ddaca62d","year":2026},"citing_paper":{"arxiv_id":"2606.23049","last_updated":"2026-06-24T02:20:35Z","snapshot_observed_at":"2026-08-12T15:24:56.726828Z","submitted_at":"2026-06-22T08:57:54Z","title":"PhoneBuddy: Training Open Models for Agentic Phone Use","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-06-26T08:15:49.428124Z"},"links":{"cited_paper":"/paper/2605.03546","citing_paper":"/paper/2606.23049"},"observation_digest":"sha256:b77bf530fc1248a0fd9f8e342f055e3880ce21cb155a36433e2229f8eeb5dae9","observation_id":"f9b5b92d-69a0-4255-a079-67aa72182e16","resolution":{"observed_at":"2026-07-04T10:59:46.417569Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"cited_work":{"arxiv_id":"2605.03546","doi":"10.1007/978-3-319-11379-1_11","metadata_source":"pith","pith_arxiv_id":"2605.03546","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","venue":"cs.SE","work_id":"2f50598d-e729-46df-95a6-6694ddaca62d","year":2026},"citing_paper":{"arxiv_id":"2606.29537","last_updated":"2026-07-13T10:30:17Z","snapshot_observed_at":"2026-08-10T22:27:17.029271Z","submitted_at":"2026-06-28T17:59:17Z","title":"OSWorld 2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-06-30T07:10:38.909339Z"},"links":{"cited_paper":"/paper/2605.03546","citing_paper":"/paper/2606.29537"},"observation_digest":"sha256:54aefb754b93f28447b35ba127a883c755cbc13b6a49862ab697534fa5e8bb07","observation_id":"7cb494e5-ef3d-49d3-82d3-6e13fd75130f","resolution":{"observed_at":"2026-06-30T07:14:21.230453Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.03546","snapshot_observed_at":"2026-07-15T10:24:53.345620Z","title":"ProgramBench: Can language models rebuild programs from scratch?, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.29537","last_updated":"2026-07-13T10:30:17Z","snapshot_observed_at":"2026-08-10T22:27:17.029271Z","submitted_at":"2026-06-28T17:59:17Z","title":"OSWorld 2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-07-15T10:24:53.345620Z"},"links":{"cited_paper":"/paper/2605.03546","citing_paper":"/paper/2606.29537"},"observation_digest":"sha256:37de1029555f4fb9321c5bc941a6cb1f77e136a293c72190e9bcde1de2ec022d","observation_id":"b24001df-3fae-46eb-8a3e-42837d9dabad","resolution":{"observed_at":"2026-07-15T10:24:53.345620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"cited_work":{"arxiv_id":"2605.03546","doi":"10.1007/978-3-319-11379-1_11","metadata_source":"pith","pith_arxiv_id":"2605.03546","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","venue":"cs.SE","work_id":"2f50598d-e729-46df-95a6-6694ddaca62d","year":2026},"citing_paper":{"arxiv_id":"2606.30182","last_updated":"2026-07-17T10:56:56Z","snapshot_observed_at":"2026-08-08T10:47:58.204777Z","submitted_at":"2026-06-29T11:57:32Z","title":"MirrorCode: AI can rebuild entire programs from behavior alone","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:32.667865Z"},"links":{"cited_paper":"/paper/2605.03546","citing_paper":"/paper/2606.30182"},"observation_digest":"sha256:5a83c6d2b7fc8d9a1139b5c266935b94bcfae3a96df107f617ebdbce9b8b18ec","observation_id":"42ab37f4-185c-4fcb-ade7-06407dd454bf","resolution":{"observed_at":"2026-06-30T06:44:19.675236Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.03546","snapshot_observed_at":"2026-08-02T09:35:02.002201Z","title":"Programbench: Can language models rebuild programs from scratch? arXiv preprint arXiv:2605.03546, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.30182","last_updated":"2026-07-17T10:56:56Z","snapshot_observed_at":"2026-08-08T10:47:58.204777Z","submitted_at":"2026-06-29T11:57:32Z","title":"MirrorCode: AI can rebuild entire programs from behavior alone","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T09:35:02.002201Z"},"links":{"cited_paper":"/paper/2605.03546","citing_paper":"/paper/2606.30182"},"observation_digest":"sha256:2744a95730957d7bd87b4cb415e53e493da148ce41adbe629fb0e7fd27e38368","observation_id":"b417fda7-9a20-4bd3-8b91-112047e66d5a","resolution":{"observed_at":"2026-08-02T09:35:02.002201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"cited_work":{"arxiv_id":"2605.03546","doi":"10.1007/978-3-319-11379-1_11","metadata_source":"pith","pith_arxiv_id":"2605.03546","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","venue":"cs.SE","work_id":"2f50598d-e729-46df-95a6-6694ddaca62d","year":2026},"citing_paper":{"arxiv_id":"2607.01087","last_updated":"2026-07-04T20:01:57Z","snapshot_observed_at":"2026-08-06T11:44:40.056045Z","submitted_at":"2026-07-01T15:44:15Z","title":"Cheap Code, Costly Judgment: A Case Study on Governable Agentic Software Engineering","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-02T08:14:31.379786Z"},"links":{"cited_paper":"/paper/2605.03546","citing_paper":"/paper/2607.01087"},"observation_digest":"sha256:40afd50ebed5dae83156f06d4c7f0a5f8d1af2a71793e6dd02127dbe1a28c17f","observation_id":"80ecb84a-28a8-4e1e-b014-8024f51ce7ee","resolution":{"observed_at":"2026-07-02T08:16:47.197371Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.03546","snapshot_observed_at":"2026-07-12T09:00:11.864155Z","title":"Available: https://arxiv.org/abs/2605.03546","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.01087","last_updated":"2026-07-04T20:01:57Z","snapshot_observed_at":"2026-08-06T11:44:40.056045Z","submitted_at":"2026-07-01T15:44:15Z","title":"Cheap Code, Costly Judgment: A Case Study on Governable Agentic Software Engineering","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T09:00:11.864155Z"},"links":{"cited_paper":"/paper/2605.03546","citing_paper":"/paper/2607.01087"},"observation_digest":"sha256:684f245dbb8625411c1f6ba382ef6c3a5c04949fd1791d11f7e5d634f0ba86a2","observation_id":"3e2e693c-94df-46e4-a847-871633a1880f","resolution":{"observed_at":"2026-07-12T09:00:11.864155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.03546","snapshot_observed_at":"2026-07-12T09:10:20.997349Z","title":"\\n\".join([f","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02606","last_updated":"2026-07-01T13:32:15Z","snapshot_observed_at":"2026-08-11T07:45:15.737230Z","submitted_at":"2026-07-01T13:32:15Z","title":"ChainSWE: Benchmarking Coding Agents on Multi-Bug Software Maintenance","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:20.997349Z"},"links":{"cited_paper":"/paper/2605.03546","citing_paper":"/paper/2607.02606"},"observation_digest":"sha256:baeaedb6c16fe9d826a96cd965ef607c3392f94a52c36c554676698d7dbffbeb","observation_id":"7dd1e738-f856-47c2-9f7a-0a8fbf2aeef7","resolution":{"observed_at":"2026-07-12T09:10:20.997349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.03546","snapshot_observed_at":"2026-07-12T01:53:29.099211Z","title":"ProgramBench: Can language models rebuild programs from scratch?, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03525","last_updated":"2026-07-15T03:41:26Z","snapshot_observed_at":"2026-08-02T08:52:20.007164Z","submitted_at":"2026-07-03T17:56:26Z","title":"GameEngineBench: Evaluating Coding Agents on Real C++ Runtime Environments","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T01:53:29.099211Z"},"links":{"cited_paper":"/paper/2605.03546","citing_paper":"/paper/2607.03525"},"observation_digest":"sha256:cd67ff04386af2be91b6d2999d1c13e8c504870e9ad819d934995fc8732b9424","observation_id":"02d33732-dc73-463e-8f34-8923d7b0426f","resolution":{"observed_at":"2026-07-12T01:53:29.099211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.03546","snapshot_observed_at":"2026-08-02T08:52:20.760608Z","title":"ProgramBench: Can language models rebuild programs from scratch?, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03525","last_updated":"2026-07-15T03:41:26Z","snapshot_observed_at":"2026-08-02T08:52:20.007164Z","submitted_at":"2026-07-03T17:56:26Z","title":"GameEngineBench: Evaluating Coding Agents on Real C++ Runtime Environments","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T08:52:20.760608Z"},"links":{"cited_paper":"/paper/2605.03546","citing_paper":"/paper/2607.03525"},"observation_digest":"sha256:b96487810bd28b90d92e4ab07484bf461b6427a9168ef14f96a6289cbff3efc5","observation_id":"9a3b249d-c456-4308-b02c-24b056bc14a8","resolution":{"observed_at":"2026-08-02T08:52:20.760608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.03546","snapshot_observed_at":"2026-07-12T01:16:50.927415Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03601","last_updated":"2026-07-03T20:58:29Z","snapshot_observed_at":"2026-08-03T18:38:21.736479Z","submitted_at":"2026-07-03T20:58:29Z","title":"ArchEval: Measuring AI Agents as Computer Architects","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-12T01:16:50.927415Z"},"links":{"cited_paper":"/paper/2605.03546","citing_paper":"/paper/2607.03601"},"observation_digest":"sha256:2f5f2c77e2610c9fb273af3db683b2c5c4cf1ca877e4e255582fa6aedfc34f01","observation_id":"f8663cfd-75fb-42d0-8bda-d2b42f5110ea","resolution":{"observed_at":"2026-07-12T01:16:50.927415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.03546","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"ProgramBench: Can language models rebuild programs from scratch?arXiv preprint arXiv:2605.03546, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-07-11T07:57:39.948830Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2605.03546","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:4529d2ec46e177c91b7e91c1f98a43688111e126db68e153f02c1440dbd4037f","observation_id":"83dd5da8-a8d8-400f-84f0-19ca19df90eb","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"cited_work":{"arxiv_id":"2605.03546","doi":"10.1007/978-3-319-11379-1_11","metadata_source":"pith","pith_arxiv_id":"2605.03546","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","venue":"cs.SE","work_id":"2f50598d-e729-46df-95a6-6694ddaca62d","year":2026},"citing_paper":{"arxiv_id":"2607.06004","last_updated":"2026-07-07T08:46:49Z","snapshot_observed_at":"2026-08-07T20:54:25.112855Z","submitted_at":"2026-07-07T08:46:49Z","title":"Large Language Models Have Unreliable Understanding of Software Engineering Terminology","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-08T20:22:54.983733Z"},"links":{"cited_paper":"/paper/2605.03546","citing_paper":"/paper/2607.06004"},"observation_digest":"sha256:af8746e07c4d23ff23fd68738b4eca5cdaf242b71bef8c00344c3efaf497787e","observation_id":"6c0e8a81-bdd9-415e-8be6-07d311a8254b","resolution":{"observed_at":"2026-07-08T20:25:37.277594Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.03546","snapshot_observed_at":"2026-08-01T12:13:01.189446Z","title":"Programbench: Can language models rebuild programs from scratch?","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19653","last_updated":"2026-07-22T01:19:42Z","snapshot_observed_at":"2026-08-07T20:07:33.820291Z","submitted_at":"2026-07-22T01:19:42Z","title":"PerfAgent: Profiler-Guided Iterative Refinement for Repository-Level Code Optimization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T12:13:01.189446Z"},"links":{"cited_paper":"/paper/2605.03546","citing_paper":"/paper/2607.19653"},"observation_digest":"sha256:9e7b70a590266b49ac4237108507cfac42ade33437ad41bcb99b7fbaa7a17ca1","observation_id":"b83b7f6f-68a8-4d7d-afd2-bda795aafdd3","resolution":{"observed_at":"2026-08-01T12:13:01.189446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.03546","snapshot_observed_at":"2026-08-01T08:11:24.237538Z","title":"Programbench: Can language models rebuild programs from scratch?","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21217","last_updated":"2026-07-23T11:31:38Z","snapshot_observed_at":"2026-08-06T15:24:46.798395Z","submitted_at":"2026-07-23T11:31:38Z","title":"ICAE-Bench: Evaluating Coding Agents as Interactive Project Builders","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T08:11:24.237538Z"},"links":{"cited_paper":"/paper/2605.03546","citing_paper":"/paper/2607.21217"},"observation_digest":"sha256:0e9c762f34811ab8cee59ef1532d93d564b01f14afb6243c38d889ca8f359cbe","observation_id":"f92f42de-b44c-4560-8ff4-913c39d620e5","resolution":{"observed_at":"2026-08-01T08:11:24.237538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.03546","snapshot_observed_at":"2026-07-30T12:11:34.990083Z","title":"ProgramBench:CanLanguageModelsRebuild Programs From Scratch?arXiv preprint arXiv:2605.03546","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27146","last_updated":"2026-07-29T17:23:02Z","snapshot_observed_at":"2026-08-07T09:02:02.312264Z","submitted_at":"2026-07-29T17:23:02Z","title":"MindForge: Teaching Small Language Models Whole-Life-Cycle Software Engineering via Source-Free Program Synthesis","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-30T12:11:34.990083Z"},"links":{"cited_paper":"/paper/2605.03546","citing_paper":"/paper/2607.27146"},"observation_digest":"sha256:07f7e6f93f717b60f44fa9971c4c0eb35fc4f168be4cd35b0dbd73f70f89dafd","observation_id":"d57c807f-6848-47f9-9cee-72b0b565b2f6","resolution":{"observed_at":"2026-07-30T12:11:34.990083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.03546","snapshot_observed_at":"2026-07-30T11:04:45.702386Z","title":"Programbench: Can language models rebuild programs from scratch?","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27167","last_updated":"2026-07-29T17:42:47Z","snapshot_observed_at":"2026-08-09T13:20:17.908254Z","submitted_at":"2026-07-29T17:42:47Z","title":"SpecFirst: Behavioral Specification Elicitation as a First-Class Step in Agent-Based Program Synthesis from Scratch","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-30T11:04:45.702386Z"},"links":{"cited_paper":"/paper/2605.03546","citing_paper":"/paper/2607.27167"},"observation_digest":"sha256:5de7ff4433aee510b9c63e33e175d0e6486a980542e74ee012465dd35f638c5c","observation_id":"793a67f3-9468-431b-9c3c-d506b09ad2d2","resolution":{"observed_at":"2026-07-30T11:04:45.702386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.03546","snapshot_observed_at":"2026-08-01T07:55:25.392621Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27409","last_updated":"2026-07-29T19:28:32Z","snapshot_observed_at":"2026-08-11T04:50:32.051040Z","submitted_at":"2026-07-29T19:28:32Z","title":"SWE-NFI: Studying and Benchmarking Coding Agents for Non-Functional Improvements","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-01T07:55:25.392621Z"},"links":{"cited_paper":"/paper/2605.03546","citing_paper":"/paper/2607.27409"},"observation_digest":"sha256:4789baea0fc7c8bf8216b304a46aa3b8a2cc3393c75910952b2e10755cc0ce96","observation_id":"3fbf6837-852b-425b-9cb2-ebdd3652d86a","resolution":{"observed_at":"2026-08-01T07:55:25.392621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.03546","snapshot_observed_at":"2026-08-12T00:12:42.031152Z","title":"2605.03546 , archivePrefix=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08311","last_updated":"2026-08-11T09:39:00Z","snapshot_observed_at":"2026-08-12T23:25:54.160666Z","submitted_at":"2026-08-08T19:45:22Z","title":"Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T00:12:42.031152Z"},"links":{"cited_paper":"/paper/2605.03546","citing_paper":"/paper/2608.08311"},"observation_digest":"sha256:f4777b56c8a4475792e0c831b4d4a373797c87860e1ad0419cb60a380dbeceab","observation_id":"7dd783a3-029e-4a27-9fc8-711f071249e1","resolution":{"observed_at":"2026-08-12T00:12:42.031152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.03546/citation-record","integrity":"/paper/2605.03546/integrity","json":"/paper/2605.03546/citation-record.json","paper":"/paper/2605.03546"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.20411","doi":"10.48550/arxiv.2505.20411","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SWE-rebench: An Automated Pipeline for Task Collection and Decontaminated Evaluation of Software Engineering Agents","venue":"ArXiv.org","work_id":"c819f5fe-32b6-41d1-aeb5-2d80c6fa8474","year":2025},"citing_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-07T16:02:16.598404Z"},"links":{"citing_paper":"/paper/2605.03546"},"observation_digest":"sha256:4a6fcbced887e6ee0a91dd9fd7d69d418000625fadb23785ea0c842b06c0e677","observation_id":"23491487-6b18-45e6-a9a2-a55a076fc98e","resolution":{"observed_at":"2026-05-11T23:56:13.353420Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:50:48.545398+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:50:48.545398+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.20779","last_updated":"2026-04-22T17:08:19Z","snapshot_observed_at":"2026-08-11T15:00:58.989029Z","submitted_at":"2026-04-22T17:08:19Z","title":"SWE-chat: Coding Agent Interactions From Real Users in the Wild","version":1},"cited_work":{"arxiv_id":"2604.20779","doi":"10.48550/arxiv.2604.20779","metadata_source":"pith","pith_arxiv_id":"2604.20779","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"SWE-chat: Coding Agent Interactions From Real Users in the Wild","venue":"cs.AI","work_id":"b0d0ecba-07d5-485a-b8e5-53676267148d","year":2026},"citing_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-07T16:02:16.598404Z"},"links":{"cited_paper":"/paper/2604.20779","citing_paper":"/paper/2605.03546"},"observation_digest":"sha256:71aa1609ef6b15fd9b50684533bb793a6e4af5468228484f6817d49004114dd1","observation_id":"2732c2d3-dbcb-43b6-8b21-67d4a240221f","resolution":{"observed_at":"2026-05-11T23:56:13.347393Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01489","last_updated":"2024-10-29T17:29:27Z","snapshot_observed_at":"2026-08-10T19:28:41.964638Z","submitted_at":"2024-07-01T17:24:45Z","title":"Agentless: Demystifying LLM-based Software Engineering Agents","version":2},"cited_work":{"arxiv_id":"2407.01489","doi":"10.48550/arxiv.2407.01489","metadata_source":"pith","pith_arxiv_id":"2407.01489","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentless: Demystifying LLM-based Software Engineering Agents","venue":"cs.SE","work_id":"71c901c4-3c83-4e10-af54-3daef7fff397","year":2024},"citing_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-07T16:02:16.598404Z"},"links":{"cited_paper":"/paper/2407.01489","citing_paper":"/paper/2605.03546"},"observation_digest":"sha256:872626907eccb5f899205e280b2f246be2abe57e3fcd04ffe8b0c695a85c2a07","observation_id":"c658db2a-4b2d-408f-ad8c-9d960b5f59cb","resolution":{"observed_at":"2026-05-12T05:12:23.134333Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-08T07:38:29.091144+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T07:38:29.091144+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.16941","last_updated":"2025-11-14T22:00:03Z","snapshot_observed_at":"2026-08-10T12:32:55.999823Z","submitted_at":"2025-09-21T06:28:17Z","title":"SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?","version":2},"cited_work":{"arxiv_id":"2509.16941","doi":"10.48550/arxiv.2509.16941","metadata_source":"pith","pith_arxiv_id":"2509.16941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?","venue":"cs.SE","work_id":"a561c78a-4b02-4053-a92a-bc5c7c5f6b9b","year":2025},"citing_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-07T16:02:16.598404Z"},"links":{"cited_paper":"/paper/2509.16941","citing_paper":"/paper/2605.03546"},"observation_digest":"sha256:df145109059eabd6fef8ed6e2ca1f566d19bc8bfdda64e37c1edec4b0fa6af29","observation_id":"3ebf38f3-0b04-491a-b912-460c64803631","resolution":{"observed_at":"2026-05-12T13:48:53.849224Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:50:48.977196+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:50:48.977196+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.21489","last_updated":"2026-07-08T16:30:55Z","snapshot_observed_at":"2026-08-11T02:33:37.941978Z","submitted_at":"2026-03-23T02:26:35Z","title":"Effective Strategies for Asynchronous Software Engineering Agents","version":2},"cited_work":{"arxiv_id":"2603.21489","doi":"10.48550/arxiv.2603.21489","metadata_source":"arxiv_reference","pith_arxiv_id":"2603.21489","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Effective strategies for asynchronous software engineering agents, 2026.https: //arxiv.org/abs/2603.21489","venue":"arXiv (Cornell University)","work_id":"cfb58415-f9af-4ec0-816a-c8b1bf857801","year":2026},"citing_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-07T16:02:16.598404Z"},"links":{"cited_paper":"/paper/2603.21489","citing_paper":"/paper/2605.03546"},"observation_digest":"sha256:cebfe4371256f4e772fbeef77f7741ddf58382830b5c404a6ceaef978793b3ed","observation_id":"da61c64a-fd80-4b54-b3b4-14ed41c5919d","resolution":{"observed_at":"2026-07-09T02:20:28.718424Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.09938","last_updated":"2021-11-08T21:16:44Z","snapshot_observed_at":"2026-08-04T23:13:25.514661Z","submitted_at":"2021-05-20T17:58:42Z","title":"Measuring Coding Challenge Competence With APPS","version":3},"cited_work":{"arxiv_id":"2105.09938","doi":"10.18653/v1/2021.eacl-main.225","metadata_source":"pith","pith_arxiv_id":"2105.09938","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Coding Challenge Competence With APPS","venue":"cs.SE","work_id":"c014c12f-1080-4cb2-ae03-ab6b7c09445c","year":2021},"citing_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-07T16:02:16.598404Z"},"links":{"cited_paper":"/paper/2105.09938","citing_paper":"/paper/2605.03546"},"observation_digest":"sha256:285902dac79ff65416239a55af2f6dcb58c4ff6b9415d22573c8b6eddb0ddd2a","observation_id":"5d2872e8-76fe-4b6e-ab67-5d80d71f2491","resolution":{"observed_at":"2026-05-11T23:56:13.394504Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02037","last_updated":"2025-05-10T15:11:34Z","snapshot_observed_at":"2026-08-09T22:35:20.991219Z","submitted_at":"2024-02-03T05:24:39Z","title":"EffiBench: Benchmarking the Efficiency of Automatically Generated Code","version":6},"cited_work":{"arxiv_id":"2402.02037","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.02037","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Effibench: Benchmarking the efficiency of automatically generated code. corr abs/2402.02037 (2024)","venue":null,"work_id":"cb99870d-d1dd-414d-9d6d-545506ce1100","year":2024},"citing_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-07T16:02:16.598404Z"},"links":{"cited_paper":"/paper/2402.02037","citing_paper":"/paper/2605.03546"},"observation_digest":"sha256:f8cf7bb6049d3bc4e8680b7ef2aba558bc3a4bd98122c6a2ccdb3ef9de107488","observation_id":"3f2c7c33-e23f-4fa7-b197-dbbfec9f3567","resolution":{"observed_at":"2026-05-11T23:56:13.388652Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-08-12T14:56:35.025839Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":"2310.06770","doi":"10.1145/512927.512945","metadata_source":"pith","pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","venue":"cs.CL","work_id":"d0effe15-a689-441a-8e3f-ea35f1c4e4b1","year":2023},"citing_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-07T16:02:16.598404Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2605.03546"},"observation_digest":"sha256:bbed97353240ce4637f9fc22d59762d38968134864e7e6ec3528491fa06c9e65","observation_id":"b5dc6ee8-1492-41db-b8e1-c2609ac3cc8b","resolution":{"observed_at":"2026-05-11T23:56:13.327585Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/tse.2015.2454513.https://doi.org/10","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T18:15:00.863488Z","title":"doi: 10.1109/TSE.2015.2454513.https://doi.org/10","venue":null,"work_id":"d3edf174-6709-4f88-a0be-88388755b4e6","year":2015},"citing_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-07T16:02:16.598404Z"},"links":{"citing_paper":"/paper/2605.03546"},"observation_digest":"sha256:0f52f00e6a52242ad54022ef37dc22ba77de98a61e702b246871ef5562d8d5bd","observation_id":"74e1376c-a74e-4f76-b723-c28bd2414375","resolution":{"observed_at":"2026-05-09T02:04:38.417879Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-12T18:11:04.754824Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-07T16:02:16.598404Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2605.03546"},"observation_digest":"sha256:466331a74654bcf748f9691c756610a70701f346d37ac7f879ebe2c9e5481050","observation_id":"32612799-a066-49b0-b250-2d8d92b0940e","resolution":{"observed_at":"2026-05-14T02:04:18.346890Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10517","last_updated":"2025-02-14T19:30:53Z","snapshot_observed_at":"2026-08-11T09:07:12.560478Z","submitted_at":"2025-02-14T19:30:53Z","title":"KernelBench: Can LLMs Write Efficient GPU Kernels?","version":1},"cited_work":{"arxiv_id":"2502.10517","doi":"10.48550/arxiv.2502.10517","metadata_source":"pith","pith_arxiv_id":"2502.10517","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"KernelBench: Can LLMs Write Efficient GPU Kernels?","venue":"cs.LG","work_id":"ee44d624-1355-4fa0-ad70-c89205f5ce5a","year":2025},"citing_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-07T16:02:16.598404Z"},"links":{"cited_paper":"/paper/2502.10517","citing_paper":"/paper/2605.03546"},"observation_digest":"sha256:b75ae9a5704ae51cdf46778cce2aa7e73f6339d2fe06ed91ff00009e503aa41a","observation_id":"3ee170c3-ed9c-4fd4-be20-f3831f7bf6f3","resolution":{"observed_at":"2026-05-15T16:55:02.220088Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.15887","doi":"10.48550/arxiv.2507.15887","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., Krupke, D., Kidger, P., Sajed, T., Stellato, B., Park, J., et al","venue":"ArXiv.org","work_id":"2c25f9d0-1696-48ff-a3b2-38c2e0d862c1","year":2025},"citing_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-07T16:02:16.598404Z"},"links":{"citing_paper":"/paper/2605.03546"},"observation_digest":"sha256:8aaff71dc79c11d3dc71da9be2a3938f2f660ead5074cd8e987e83cb66389626","observation_id":"3ebec05b-a78d-4660-b4c0-8907d37d49a4","resolution":{"observed_at":"2026-05-11T23:56:13.411871Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.23671","doi":"10.48550/arxiv.2505.23671","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"14 Manish Shetty, Naman Jain, Jinjian Liu, Vijay Kethanaboyina, Koushik Sen, and Ion Stoica","venue":"arXiv (Cornell University)","work_id":"1c5612e2-fc9d-44e4-9e75-3ad4a5cc3388","year":2025},"citing_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-07T16:02:16.598404Z"},"links":{"citing_paper":"/paper/2605.03546"},"observation_digest":"sha256:64ac385fef279cb9d7a1487c2ec56c8945cb2b0374a211488a58789508556249","observation_id":"06e4e3f1-2dae-412d-960e-490812c3f472","resolution":{"observed_at":"2026-05-11T23:56:13.361717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:46.249771+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:46.249771+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.18470","last_updated":"2026-04-04T09:52:04Z","snapshot_observed_at":"2026-07-30T13:30:43.108201Z","submitted_at":"2025-12-20T19:08:15Z","title":"SWE-EVO: Benchmarking Coding Agents in Long-Horizon Software Evolution Scenarios","version":5},"cited_work":{"arxiv_id":"2512.18470","doi":"10.48550/arxiv.2512.18470","metadata_source":"pith","pith_arxiv_id":"2512.18470","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"SWE-EVO: Benchmarking Coding Agents in Long-Horizon Software Evolution Scenarios","venue":"cs.SE","work_id":"4dc0b41e-24de-4bd4-8e7d-9dccefa116f8","year":2025},"citing_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-07T16:02:16.598404Z"},"links":{"cited_paper":"/paper/2512.18470","citing_paper":"/paper/2605.03546"},"observation_digest":"sha256:35aee310c10d37cd0d1a8785ebe98a44ff1b2ff246008b8faf00c4fc0ae92014","observation_id":"9b74c08e-5aca-4489-9732-84c2bc29875e","resolution":{"observed_at":"2026-05-11T23:56:13.321829Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:38:06.868017+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T06:38:06.868017+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14044","last_updated":"2024-10-09T22:20:40Z","snapshot_observed_at":"2026-08-12T23:18:58.096337Z","submitted_at":"2024-07-19T05:47:40Z","title":"ECCO: Can We Improve Model-Generated Code Efficiency Without Sacrificing Functional Correctness?","version":2},"cited_work":{"arxiv_id":"2407.14044","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14044","snapshot_observed_at":"2026-07-03T21:08:57.936945Z","title":"Ecco: Can we improve model-generated code efficiency without sacrificing functional correctness?","venue":null,"work_id":"91e1c3b2-0f40-42fe-a971-97dfe5ac108c","year":2024},"citing_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-07T16:02:16.598404Z"},"links":{"cited_paper":"/paper/2407.14044","citing_paper":"/paper/2605.03546"},"observation_digest":"sha256:81664456a590b153956f370e696c87b85334206318a1f183088cd03202c19323","observation_id":"96b3cbc3-d577-4412-87c4-f28dba077f05","resolution":{"observed_at":"2026-05-11T23:56:13.333810Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23145","last_updated":"2025-08-08T07:13:11Z","snapshot_observed_at":"2026-08-07T16:28:20.940391Z","submitted_at":"2025-03-29T16:50:39Z","title":"CodeARC: Benchmarking Reasoning Capabilities of LLM Agents for Inductive Program Synthesis","version":2},"cited_work":{"arxiv_id":"2503.23145","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23145","snapshot_observed_at":"2026-07-03T05:57:41.614431Z","title":"Codearc: Benchmarking reasoning capabilities of llm agents for inductive program synthesis.arXiv preprint arXiv:2503.23145","venue":null,"work_id":"71b19bd9-274c-47dd-8c1c-6fc5bfdc43df","year":2025},"citing_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-07T16:02:16.598404Z"},"links":{"cited_paper":"/paper/2503.23145","citing_paper":"/paper/2605.03546"},"observation_digest":"sha256:7c220dd822de59a388d99d4e160ffc1e9fd085701e2b2857bfb467974b5099a0","observation_id":"521c5a30-4917-4235-8906-c77e34d7aa29","resolution":{"observed_at":"2026-05-11T23:56:13.383861Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15793","last_updated":"2024-11-11T20:01:15Z","snapshot_observed_at":"2026-07-06T18:19:29.996982Z","submitted_at":"2024-05-06T17:41:33Z","title":"SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering","version":3},"cited_work":{"arxiv_id":"2405.15793","doi":"10.48550/arxiv.2405.15793","metadata_source":"pith","pith_arxiv_id":"2405.15793","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering","venue":"cs.SE","work_id":"01826cd9-a652-403c-a2ec-531da9fe2b6a","year":2024},"citing_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-07T16:02:16.598404Z"},"links":{"cited_paper":"/paper/2405.15793","citing_paper":"/paper/2605.03546"},"observation_digest":"sha256:741f8b1e11e1f6691950f51203890af7a89f631228c49e12ddd86917f87d2ee5","observation_id":"bf80bdb8-7412-4e37-9977-190650dea79a","resolution":{"observed_at":"2026-05-11T23:56:13.309437Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:24.962823+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:24.962823+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21798","last_updated":"2025-05-21T17:21:45Z","snapshot_observed_at":"2026-08-11T02:21:44.551484Z","submitted_at":"2025-04-30T16:56:06Z","title":"SWE-smith: Scaling Data for Software Engineering Agents","version":2},"cited_work":{"arxiv_id":"2504.21798","doi":"10.48550/arxiv.2504.21798","metadata_source":"pith","pith_arxiv_id":"2504.21798","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SWE-smith: Scaling Data for Software Engineering Agents","venue":"cs.SE","work_id":"6a906763-2e4e-4cea-a19c-d7a169c9376b","year":2025},"citing_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-07T16:02:16.598404Z"},"links":{"cited_paper":"/paper/2504.21798","citing_paper":"/paper/2605.03546"},"observation_digest":"sha256:232ae98577da6406f08d96f45f1be06c1317974572568be35cb12facf7787690","observation_id":"aa33546a-0a4e-435e-888e-ddbcc12cc5e6","resolution":{"observed_at":"2026-05-15T10:22:07.061654Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"07c9460b-12be-41c4-954b-755594cfcf5b","year":1936},"citing_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-07T16:02:16.598404Z"},"links":{"citing_paper":"/paper/2605.03546"},"observation_digest":"sha256:a7013c9dcaa9eeda6ece70bc89a5fc7e8f5a03bd8bd190bb477a39d9ce980c9e","observation_id":"8c3fc952-9b6d-4c25-a771-e3cc3a85fb49","resolution":{"observed_at":"2026-05-27T02:38:42.966033Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"blocklist","venue":null,"work_id":"2ad759c5-9669-423b-ab0f-9366a88829e6","year":2000},"citing_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-07T16:02:16.598404Z"},"links":{"citing_paper":"/paper/2605.03546"},"observation_digest":"sha256:f62389cbb07ad0759b8835133890d6e8c0643e90e3ef977657d10a8225093d7f","observation_id":"1e3bf5a8-11fb-41de-816a-6d8e5049f672","resolution":{"observed_at":"2026-05-27T02:38:42.968572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dependency count.Of the 200 repositories, 171 (85.5%) contain a recognized package manifest file; among these, the median repository declares 17 total dependencies (12 runtime)","venue":null,"work_id":"040ae209-2a33-4f02-ad56-15a033e958f9","year":2025},"citing_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-07T16:02:16.598404Z"},"links":{"citing_paper":"/paper/2605.03546"},"observation_digest":"sha256:9a34b3b8bdfac980dfcfc44c873428d75b537ba9f6640ce5d1a405490ddc7a96","observation_id":"a1e91875-76e0-439e-9b01-84a3f117e77d","resolution":{"observed_at":"2026-05-27T02:38:42.971660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":7,"parse_uncertain":0,"unresolved":1,"verified_exact":11,"verified_fuzzy":2},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 26 inbound Pith citation observations for arXiv:2605.03546."}