{"as_of":"2026-08-10T16:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3bab78dbf8e977cb0072026607ee20990b559cd2cb108ad1d0d901de9bd5a0bb","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T01:05:44.229751Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.00661/citation-record","integrity":"/paper/2608.00661/integrity","json":"/paper/2608.00661/citation-record.json","paper":"/paper/2608.00661"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:05:41.675067Z","title":"https://web.archive.org/web/20250430014530/https://www.cnbc.c om/2025/04/29/satya-nadella-says-as-much-as-30percent-of-microsoft -code-is-written-by-ai.html","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00661","last_updated":"2026-08-01T13:31:42Z","snapshot_observed_at":"2026-08-08T03:15:07.866707Z","submitted_at":"2026-08-01T13:31:42Z","title":"Unreliable in Practice? A Comprehensive Study of Errors in LLM-Generated Code","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T01:05:41.675067Z"},"links":{"citing_paper":"/paper/2608.00661"},"observation_digest":"sha256:052ea1f55fdcbdbf830f6d93d8bde7667fe190a89e5692e5ba2626928a253ef0","observation_id":"15cba260-eddc-4c60-888d-f72311fbdbe8","resolution":{"observed_at":"2026-08-04T01:05:41.675067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:05:41.751618Z","title":"Microsoft cto breaks down how he sees software developer jobs evolving in the next 5 years,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00661","last_updated":"2026-08-01T13:31:42Z","snapshot_observed_at":"2026-08-08T03:15:07.866707Z","submitted_at":"2026-08-01T13:31:42Z","title":"Unreliable in Practice? A Comprehensive Study of Errors in LLM-Generated Code","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T01:05:41.751618Z"},"links":{"citing_paper":"/paper/2608.00661"},"observation_digest":"sha256:893278e6ea8b878b3e1fb2272a8d45e55ed7783b3cbd2e183f8fc3728ae4f8f5","observation_id":"33e7358e-1098-4ed8-b038-f3a6dac0321a","resolution":{"observed_at":"2026-08-04T01:05:41.751618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:05:41.806283Z","title":"The impact of ai on developer productivity: Evidence from github copilot,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00661","last_updated":"2026-08-01T13:31:42Z","snapshot_observed_at":"2026-08-08T03:15:07.866707Z","submitted_at":"2026-08-01T13:31:42Z","title":"Unreliable in Practice? A Comprehensive Study of Errors in LLM-Generated Code","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T01:05:41.806283Z"},"links":{"citing_paper":"/paper/2608.00661"},"observation_digest":"sha256:d3a574ca86d16a50fa05374e05b323a68eff64637c979d4321fb67bc9fe13893","observation_id":"c4267c5e-f440-42dd-982a-10b61c90636d","resolution":{"observed_at":"2026-08-04T01:05:41.806283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:05:41.894341Z","title":"The effects of github copilot on computing students’ pro- gramming effectiveness, efficiency, and processes in brownfield coding tasks,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00661","last_updated":"2026-08-01T13:31:42Z","snapshot_observed_at":"2026-08-08T03:15:07.866707Z","submitted_at":"2026-08-01T13:31:42Z","title":"Unreliable in Practice? A Comprehensive Study of Errors in LLM-Generated Code","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T01:05:41.894341Z"},"links":{"citing_paper":"/paper/2608.00661"},"observation_digest":"sha256:d6e198628347085e7c4f0af6e597366abe836ed49328c9085e445c59bfd0b3be","observation_id":"63c78d1e-7012-4c52-af23-79978bb34b1c","resolution":{"observed_at":"2026-08-04T01:05:41.894341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:05:41.981644Z","title":"Measuring coding challenge competence with apps,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.00661","last_updated":"2026-08-01T13:31:42Z","snapshot_observed_at":"2026-08-08T03:15:07.866707Z","submitted_at":"2026-08-01T13:31:42Z","title":"Unreliable in Practice? A Comprehensive Study of Errors in LLM-Generated Code","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T01:05:41.981644Z"},"links":{"citing_paper":"/paper/2608.00661"},"observation_digest":"sha256:66183ea544554ae5cfa543d0579ba90e92c5da7db5cb23a86c2b39e10f6bb211","observation_id":"40e73a8e-6593-433d-90ab-521a6f8a380c","resolution":{"observed_at":"2026-08-04T01:05:41.981644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:05:42.076119Z","title":"Beyond functional correctness: An empirical evaluation of large language models for text- to-code generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00661","last_updated":"2026-08-01T13:31:42Z","snapshot_observed_at":"2026-08-08T03:15:07.866707Z","submitted_at":"2026-08-01T13:31:42Z","title":"Unreliable in Practice? A Comprehensive Study of Errors in LLM-Generated Code","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T01:05:42.076119Z"},"links":{"citing_paper":"/paper/2608.00661"},"observation_digest":"sha256:2bb6f98df1e68ec7bd164e6f3c7fdb42ca44f5af07e2d01d70518e23d8da5903","observation_id":"02c554f0-847a-4efa-9653-266f8cb0d0eb","resolution":{"observed_at":"2026-08-04T01:05:42.076119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:05:42.179583Z","title":"Exploring and evaluating hallucinations in llm-powered code generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00661","last_updated":"2026-08-01T13:31:42Z","snapshot_observed_at":"2026-08-08T03:15:07.866707Z","submitted_at":"2026-08-01T13:31:42Z","title":"Unreliable in Practice? A Comprehensive Study of Errors in LLM-Generated Code","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T01:05:42.179583Z"},"links":{"citing_paper":"/paper/2608.00661"},"observation_digest":"sha256:8daf9e56ad7fdceec5468bfe74a41b311b0a05cf32fd6caade7bf1d5267118e3","observation_id":"e540e0a8-7a88-4b51-b22f-80d0b6a3667a","resolution":{"observed_at":"2026-08-04T01:05:42.179583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:05:42.273701Z","title":"Towards understanding the characteristics of code generation errors made by large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00661","last_updated":"2026-08-01T13:31:42Z","snapshot_observed_at":"2026-08-08T03:15:07.866707Z","submitted_at":"2026-08-01T13:31:42Z","title":"Unreliable in Practice? A Comprehensive Study of Errors in LLM-Generated Code","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T01:05:42.273701Z"},"links":{"citing_paper":"/paper/2608.00661"},"observation_digest":"sha256:e7dc7b5b3a8f10a5574d6783d63b383477208ab8ad9947cd8ed6fd160854a087","observation_id":"c79a2b6a-8d52-4197-adf3-520f7031fc04","resolution":{"observed_at":"2026-08-04T01:05:42.273701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:05:42.375284Z","title":"An empirical study of code generation errors made by large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00661","last_updated":"2026-08-01T13:31:42Z","snapshot_observed_at":"2026-08-08T03:15:07.866707Z","submitted_at":"2026-08-01T13:31:42Z","title":"Unreliable in Practice? A Comprehensive Study of Errors in LLM-Generated Code","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T01:05:42.375284Z"},"links":{"citing_paper":"/paper/2608.00661"},"observation_digest":"sha256:01cb4ff88f55af4126939f2b9e8257bf2c64f231e8b0930b674d97d6ac21d504","observation_id":"d4d30bed-c8c7-4c0c-b68d-37316fe2a135","resolution":{"observed_at":"2026-08-04T01:05:42.375284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:05:42.455980Z","title":"Bugs in large language models generated code: An empirical study,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00661","last_updated":"2026-08-01T13:31:42Z","snapshot_observed_at":"2026-08-08T03:15:07.866707Z","submitted_at":"2026-08-01T13:31:42Z","title":"Unreliable in Practice? A Comprehensive Study of Errors in LLM-Generated Code","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T01:05:42.455980Z"},"links":{"citing_paper":"/paper/2608.00661"},"observation_digest":"sha256:a3e0d0cd87fdfc3b814bbbfe07bb989b2de6ec2322f711a9a9a0dd978177c6ae","observation_id":"08904398-f20a-4d56-b733-bd39957c8e55","resolution":{"observed_at":"2026-08-04T01:05:42.455980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:05:42.569627Z","title":"No need to lift a finger anymore? assessing the quality of code generation by chatgpt,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00661","last_updated":"2026-08-01T13:31:42Z","snapshot_observed_at":"2026-08-08T03:15:07.866707Z","submitted_at":"2026-08-01T13:31:42Z","title":"Unreliable in Practice? A Comprehensive Study of Errors in LLM-Generated Code","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T01:05:42.569627Z"},"links":{"citing_paper":"/paper/2608.00661"},"observation_digest":"sha256:163ebcf9db2e5316b00753ea05bd4854b6d36faad7bee664d91cb1266c28cf7c","observation_id":"5c7eb81b-0e6f-4aaa-b5d0-da8c0a08f5f2","resolution":{"observed_at":"2026-08-04T01:05:42.569627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01414","last_updated":"2025-03-20T11:21:07Z","snapshot_observed_at":"2026-08-08T05:24:39.480958Z","submitted_at":"2024-11-03T02:47:03Z","title":"A Deep Dive Into Large Language Model Code Generation Mistakes: What and Why?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01414","snapshot_observed_at":"2026-08-04T01:05:42.673499Z","title":"A deep dive into large language model code generation mistakes: What and why?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00661","last_updated":"2026-08-01T13:31:42Z","snapshot_observed_at":"2026-08-08T03:15:07.866707Z","submitted_at":"2026-08-01T13:31:42Z","title":"Unreliable in Practice? A Comprehensive Study of Errors in LLM-Generated Code","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T01:05:42.673499Z"},"links":{"cited_paper":"/paper/2411.01414","citing_paper":"/paper/2608.00661"},"observation_digest":"sha256:2914cbe770ddfe50d01c900fecf206d09e43152fbd4190f0857812b803201e38","observation_id":"c89a02d9-deb8-4ece-a8f0-61a8e2ff2d53","resolution":{"observed_at":"2026-08-04T01:05:42.673499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:05:42.770880Z","title":"Assessing and analyzing the correctness of github copilot’s code suggestions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00661","last_updated":"2026-08-01T13:31:42Z","snapshot_observed_at":"2026-08-08T03:15:07.866707Z","submitted_at":"2026-08-01T13:31:42Z","title":"Unreliable in Practice? A Comprehensive Study of Errors in LLM-Generated Code","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T01:05:42.770880Z"},"links":{"citing_paper":"/paper/2608.00661"},"observation_digest":"sha256:254e446c8ad0257d7e00df7a3c91c0aef83e9a35160c471e95ac3030a3bfb6c9","observation_id":"9c76c0c5-00db-482f-a258-b5f56c21ae81","resolution":{"observed_at":"2026-08-04T01:05:42.770880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:05:42.868042Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00661","last_updated":"2026-08-01T13:31:42Z","snapshot_observed_at":"2026-08-08T03:15:07.866707Z","submitted_at":"2026-08-01T13:31:42Z","title":"Unreliable in Practice? A Comprehensive Study of Errors in LLM-Generated Code","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T01:05:42.868042Z"},"links":{"citing_paper":"/paper/2608.00661"},"observation_digest":"sha256:ca136996277e2e9148d4e20a62cbe8413248396715ec807c48884c1f56950d26","observation_id":"16bb1223-c45c-414d-a8a3-2027d4653bb9","resolution":{"observed_at":"2026-08-04T01:05:42.868042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-04T01:05:43.031051Z","title":"Deepseek-v3 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00661","last_updated":"2026-08-01T13:31:42Z","snapshot_observed_at":"2026-08-08T03:15:07.866707Z","submitted_at":"2026-08-01T13:31:42Z","title":"Unreliable in Practice? A Comprehensive Study of Errors in LLM-Generated Code","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T01:05:43.031051Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2608.00661"},"observation_digest":"sha256:364d8c34fe875a444d28b38e01db560d006b8ddd6a977fc28f04b8fcd0f0e253","observation_id":"75978369-e80b-4df0-ab41-b283685d77f5","resolution":{"observed_at":"2026-08-04T01:05:43.031051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11931","last_updated":"2024-06-17T13:51:35Z","snapshot_observed_at":"2026-08-07T06:30:25.302107Z","submitted_at":"2024-06-17T13:51:35Z","title":"DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11931","snapshot_observed_at":"2026-08-04T01:05:43.179400Z","title":"Deepseek-coder-v2: Breaking the barrier of closed-source models in code intelligence,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00661","last_updated":"2026-08-01T13:31:42Z","snapshot_observed_at":"2026-08-08T03:15:07.866707Z","submitted_at":"2026-08-01T13:31:42Z","title":"Unreliable in Practice? A Comprehensive Study of Errors in LLM-Generated Code","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T01:05:43.179400Z"},"links":{"cited_paper":"/paper/2406.11931","citing_paper":"/paper/2608.00661"},"observation_digest":"sha256:36eac0905b3a7761995e0a7a8f4c8e254e84feac0388041e5fac3cb6cf1390de","observation_id":"25b21f5f-1578-42f9-9ef3-0283fbcfdcd1","resolution":{"observed_at":"2026-08-04T01:05:43.179400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:05:43.291943Z","title":"Qwen2.5-coder technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00661","last_updated":"2026-08-01T13:31:42Z","snapshot_observed_at":"2026-08-08T03:15:07.866707Z","submitted_at":"2026-08-01T13:31:42Z","title":"Unreliable in Practice? A Comprehensive Study of Errors in LLM-Generated Code","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T01:05:43.291943Z"},"links":{"citing_paper":"/paper/2608.00661"},"observation_digest":"sha256:74c9df548e6925c7a3ec85cb07f4d81fb283ede7bcb690fd7b7c01e832fc7a49","observation_id":"d542d80a-b233-43b3-a295-3b6a23f6cc68","resolution":{"observed_at":"2026-08-04T01:05:43.291943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:05:43.426461Z","title":"Incoder: A generative model for code infilling and synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00661","last_updated":"2026-08-01T13:31:42Z","snapshot_observed_at":"2026-08-08T03:15:07.866707Z","submitted_at":"2026-08-01T13:31:42Z","title":"Unreliable in Practice? A Comprehensive Study of Errors in LLM-Generated Code","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T01:05:43.426461Z"},"links":{"citing_paper":"/paper/2608.00661"},"observation_digest":"sha256:3bf4e44f9073d8d71b58334a533eea749298908044efc8536466402e35d07a1b","observation_id":"59edae2c-ad76-45a4-ac5d-214238c1054a","resolution":{"observed_at":"2026-08-04T01:05:43.426461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:05:43.563626Z","title":"Evaluating large language models trained on code,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.00661","last_updated":"2026-08-01T13:31:42Z","snapshot_observed_at":"2026-08-08T03:15:07.866707Z","submitted_at":"2026-08-01T13:31:42Z","title":"Unreliable in Practice? A Comprehensive Study of Errors in LLM-Generated Code","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T01:05:43.563626Z"},"links":{"citing_paper":"/paper/2608.00661"},"observation_digest":"sha256:713de31e7e7d228d3e5108d794a10bfecb56202aa3e93a28f72a6118cb5f8f46","observation_id":"e87f8893-dafa-4dd2-bbd2-9411519eb854","resolution":{"observed_at":"2026-08-04T01:05:43.563626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:05:43.649024Z","title":"A large scale study of programming languages and code quality in github,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.00661","last_updated":"2026-08-01T13:31:42Z","snapshot_observed_at":"2026-08-08T03:15:07.866707Z","submitted_at":"2026-08-01T13:31:42Z","title":"Unreliable in Practice? A Comprehensive Study of Errors in LLM-Generated Code","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T01:05:43.649024Z"},"links":{"citing_paper":"/paper/2608.00661"},"observation_digest":"sha256:89eda73b45269f91297aea28ee59f0b2c30cd4e8abd672bcd61f3a78e35e014e","observation_id":"b9dd5a41-8d70-4fd9-a21f-f294b5fd0d4c","resolution":{"observed_at":"2026-08-04T01:05:43.649024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:05:43.749086Z","title":"Orthogonal defect classification-a concept for in- process measurements,","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2608.00661","last_updated":"2026-08-01T13:31:42Z","snapshot_observed_at":"2026-08-08T03:15:07.866707Z","submitted_at":"2026-08-01T13:31:42Z","title":"Unreliable in Practice? A Comprehensive Study of Errors in LLM-Generated Code","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T01:05:43.749086Z"},"links":{"citing_paper":"/paper/2608.00661"},"observation_digest":"sha256:a9877cd26b8822e14589d202fbefc583191769bd5ff0d5ba241d31718fc5d744","observation_id":"d83f5a41-8d31-4bc2-9944-9ac88e88ac1e","resolution":{"observed_at":"2026-08-04T01:05:43.749086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:05:43.807074Z","title":"Program synthesis with large language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.00661","last_updated":"2026-08-01T13:31:42Z","snapshot_observed_at":"2026-08-08T03:15:07.866707Z","submitted_at":"2026-08-01T13:31:42Z","title":"Unreliable in Practice? A Comprehensive Study of Errors in LLM-Generated Code","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T01:05:43.807074Z"},"links":{"citing_paper":"/paper/2608.00661"},"observation_digest":"sha256:e28013f74c396a40713168e2911e36be190c82c7cd11b99d40d745a9bac7a93b","observation_id":"eddd760d-3cf2-4af1-929f-f1b3127f923a","resolution":{"observed_at":"2026-08-04T01:05:43.807074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:05:43.878756Z","title":"Codexglue: A machine learning benchmark dataset for code understanding and generation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.00661","last_updated":"2026-08-01T13:31:42Z","snapshot_observed_at":"2026-08-08T03:15:07.866707Z","submitted_at":"2026-08-01T13:31:42Z","title":"Unreliable in Practice? A Comprehensive Study of Errors in LLM-Generated Code","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T01:05:43.878756Z"},"links":{"citing_paper":"/paper/2608.00661"},"observation_digest":"sha256:2faec7f6ae2bb09d0e04e544f7ee0b29326ba1b908d3cf77caffd1bb4df3a9fb","observation_id":"9ea8050f-a33b-410e-9c72-78f987353dff","resolution":{"observed_at":"2026-08-04T01:05:43.878756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.13820","last_updated":"2026-07-15T13:28:18Z","snapshot_observed_at":"2026-08-08T03:14:24.536574Z","submitted_at":"2026-07-15T13:28:18Z","title":"PROBE: Benchmarking Code Generation in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.13820","snapshot_observed_at":"2026-08-04T01:05:44.021875Z","title":"Probe: Benchmarking code generation in large language models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.00661","last_updated":"2026-08-01T13:31:42Z","snapshot_observed_at":"2026-08-08T03:15:07.866707Z","submitted_at":"2026-08-01T13:31:42Z","title":"Unreliable in Practice? A Comprehensive Study of Errors in LLM-Generated Code","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T01:05:44.021875Z"},"links":{"cited_paper":"/paper/2607.13820","citing_paper":"/paper/2608.00661"},"observation_digest":"sha256:5d5e182e2abd345a658ebb6a6fa389a4f5a5f0dbeaaf7937b992bbb2208c769a","observation_id":"0f48bb42-a000-4a5c-a932-9d11f02dcaab","resolution":{"observed_at":"2026-08-04T01:05:44.021875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:05:44.092272Z","title":"Codenet: A large-scale ai for code dataset for learning a diversity of coding tasks,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.00661","last_updated":"2026-08-01T13:31:42Z","snapshot_observed_at":"2026-08-08T03:15:07.866707Z","submitted_at":"2026-08-01T13:31:42Z","title":"Unreliable in Practice? A Comprehensive Study of Errors in LLM-Generated Code","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T01:05:44.092272Z"},"links":{"citing_paper":"/paper/2608.00661"},"observation_digest":"sha256:b1fbd5298da6278466c8c3e05e7ffebbe9935ac573fd65ecf67f3322dca126a6","observation_id":"ac0aedb3-fe5c-4fcb-be57-6082c2817cae","resolution":{"observed_at":"2026-08-04T01:05:44.092272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:05:44.132381Z","title":"The measurement of observer agreement for categorical data,","venue":null,"work_id":null,"year":1977},"citing_paper":{"arxiv_id":"2608.00661","last_updated":"2026-08-01T13:31:42Z","snapshot_observed_at":"2026-08-08T03:15:07.866707Z","submitted_at":"2026-08-01T13:31:42Z","title":"Unreliable in Practice? A Comprehensive Study of Errors in LLM-Generated Code","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T01:05:44.132381Z"},"links":{"citing_paper":"/paper/2608.00661"},"observation_digest":"sha256:7427d2f043abb6ce48f055f78fa6bf3728340dc1029cc15e8a7dbe321edf1dca","observation_id":"3e0c5cb3-7c1e-488f-8062-83ea873859b7","resolution":{"observed_at":"2026-08-04T01:05:44.132381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:05:44.229751Z","title":"Polyglot: An extensible framework to benchmark code translation with llms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00661","last_updated":"2026-08-01T13:31:42Z","snapshot_observed_at":"2026-08-08T03:15:07.866707Z","submitted_at":"2026-08-01T13:31:42Z","title":"Unreliable in Practice? A Comprehensive Study of Errors in LLM-Generated Code","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T01:05:44.229751Z"},"links":{"citing_paper":"/paper/2608.00661"},"observation_digest":"sha256:89f5bb0e1f88c54b2b1938ed5f8dca909aeb78d3e8ebf7d71aefdb5c6957a044","observation_id":"4704d800-7f0b-4228-91b7-d3baf708b730","resolution":{"observed_at":"2026-08-04T01:05:44.229751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.00661","last_updated":"2026-08-01T13:31:42Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-08T03:15:07.866707Z","submitted_at":"2026-08-01T13:31:42Z","title":"Unreliable in Practice? A Comprehensive Study of Errors in LLM-Generated Code"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2608.00661."}