{"as_of":"2026-08-14T15:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:40b2a74ae2c7b905d976121dd2d9ad16ccb77b1870350da5def45384d6e5a99d","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T22:55:49.377456Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.09059/citation-record","integrity":"/paper/2605.09059/integrity","json":"/paper/2605.09059/citation-record.json","paper":"/paper/2605.09059"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2210.14868","last_updated":"2023-03-28T19:02:34Z","snapshot_observed_at":"2026-08-13T13:55:50.351355Z","submitted_at":"2022-10-26T17:17:06Z","title":"Multi-lingual Evaluation of Code Generation Models","version":3},"cited_work":{"arxiv_id":"2210.14868","doi":"10.48550/arxiv.2210.14868","metadata_source":"arxiv_reference","pith_arxiv_id":"2210.14868","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multi-lingual evaluation of code generation models","venue":"arXiv (Cornell University)","work_id":"1283984e-956f-4584-8b1a-ae121c31626c","year":2023},"citing_paper":{"arxiv_id":"2605.09059","last_updated":"2026-06-09T18:21:19Z","snapshot_observed_at":"2026-07-06T23:21:11.475005Z","submitted_at":"2026-05-09T17:05:44Z","title":"Evaluating LLM-Generated Code: A Benchmark and Developer Study","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T22:55:49.377456Z"},"links":{"cited_paper":"/paper/2210.14868","citing_paper":"/paper/2605.09059"},"observation_digest":"sha256:d286a86c1206b87f8a5f73a02df8ec85accf3cfbbce0c99cfd709dbcf60e2b07","observation_id":"3c81cd13-b026-4d1d-85f3-527c77d0b89d","resolution":{"observed_at":"2026-07-01T13:35:46.801549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":"2108.07732","doi":"10.1007/s11390-025-5518-5","metadata_source":"pith","pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Program Synthesis with Large Language Models","venue":"cs.PL","work_id":"fd241a05-03b9-4de2-9588-9d77ce176125","year":2021},"citing_paper":{"arxiv_id":"2605.09059","last_updated":"2026-06-09T18:21:19Z","snapshot_observed_at":"2026-07-06T23:21:11.475005Z","submitted_at":"2026-05-09T17:05:44Z","title":"Evaluating LLM-Generated Code: A Benchmark and Developer Study","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T22:55:49.377456Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2605.09059"},"observation_digest":"sha256:737fed6f87103c4c49eae5dcbf74a7a8c6cf67a16a68cf4e9a78780d54c35aa1","observation_id":"d14f189c-a05e-45b4-b15f-b5f1eb49c966","resolution":{"observed_at":"2026-07-01T13:35:46.804017Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2605.09059","last_updated":"2026-06-09T18:21:19Z","snapshot_observed_at":"2026-07-06T23:21:11.475005Z","submitted_at":"2026-05-09T17:05:44Z","title":"Evaluating LLM-Generated Code: A Benchmark and Developer Study","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T22:55:49.377456Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2605.09059"},"observation_digest":"sha256:c14a2688cb1f5b3083c32a0466a39b37da535c0f06d58f60712d91c65190dddc","observation_id":"dc07e2ef-d11f-4c9c-9190-4e39167c3f3b","resolution":{"observed_at":"2026-07-01T13:35:46.806529Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T12:23:48.899798Z","title":"2025.The Temperature Parameter | DeepSeek API Docs","venue":null,"work_id":"5215ad0e-81fa-48cb-8e6a-02c64a56d2a3","year":2025},"citing_paper":{"arxiv_id":"2605.09059","last_updated":"2026-06-09T18:21:19Z","snapshot_observed_at":"2026-07-06T23:21:11.475005Z","submitted_at":"2026-05-09T17:05:44Z","title":"Evaluating LLM-Generated Code: A Benchmark and Developer Study","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T22:55:49.377456Z"},"links":{"citing_paper":"/paper/2605.09059"},"observation_digest":"sha256:308ce5bd7f0a5e129cbc720bcdc30fda9bca40c21c63ccaf76c6ccb76dc25e6c","observation_id":"75aebb0f-9b15-4152-a351-77a32e5f0155","resolution":{"observed_at":"2026-07-07T12:23:48.901394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7503.363921","doi":"10.1145/3597503.3639210","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models in Class-Level Code Generation","venue":null,"work_id":"2c519028-986b-41c8-aea4-b06044f3e700","year":2024},"citing_paper":{"arxiv_id":"2605.09059","last_updated":"2026-06-09T18:21:19Z","snapshot_observed_at":"2026-07-06T23:21:11.475005Z","submitted_at":"2026-05-09T17:05:44Z","title":"Evaluating LLM-Generated Code: A Benchmark and Developer Study","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T22:55:49.377456Z"},"links":{"citing_paper":"/paper/2605.09059"},"observation_digest":"sha256:bf5d937d25ed0c1d59b0176791b3642feeedf52dbb75fefef35404384d7fec96","observation_id":"2d450392-3896-42c8-ad21-3a69b35ea363","resolution":{"observed_at":"2026-06-30T23:05:06.703990Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21071","last_updated":"2024-10-28T14:34:36Z","snapshot_observed_at":"2026-08-14T00:49:03.935828Z","submitted_at":"2024-10-28T14:34:36Z","title":"Automatic Generation of Benchmarks and Reliable LLM Judgment for Code Tasks","version":1},"cited_work":{"arxiv_id":"2410.21071","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21071","snapshot_observed_at":"2026-07-01T13:35:46.807753Z","title":null,"venue":null,"work_id":"c28b2bfa-d862-4642-82eb-3c36907fff42","year":2024},"citing_paper":{"arxiv_id":"2605.09059","last_updated":"2026-06-09T18:21:19Z","snapshot_observed_at":"2026-07-06T23:21:11.475005Z","submitted_at":"2026-05-09T17:05:44Z","title":"Evaluating LLM-Generated Code: A Benchmark and Developer Study","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T22:55:49.377456Z"},"links":{"cited_paper":"/paper/2410.21071","citing_paper":"/paper/2605.09059"},"observation_digest":"sha256:41a34f2bff6f67153f795ac591552c45fa9931ba37db4a82097aa3a9bdfb4e41","observation_id":"9c21b4fd-54fb-404a-9f69-7c29d61068cf","resolution":{"observed_at":"2026-07-01T13:35:46.809139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.09588","last_updated":"2018-08-29T00:08:25Z","snapshot_observed_at":"2026-08-08T17:13:58.133122Z","submitted_at":"2018-08-29T00:08:25Z","title":"Mapping Language to Code in Programmatic Context","version":1},"cited_work":{"arxiv_id":"1808.09588","doi":"10.48550/arxiv.1808.09588","metadata_source":"pith","pith_arxiv_id":"1808.09588","snapshot_observed_at":"2026-07-10T18:15:00.821465Z","title":"Mapping Language to Code in Programmatic Context","venue":"cs.CL","work_id":"09a3fec1-858d-48a9-ab07-243d11bc221f","year":2018},"citing_paper":{"arxiv_id":"2605.09059","last_updated":"2026-06-09T18:21:19Z","snapshot_observed_at":"2026-07-06T23:21:11.475005Z","submitted_at":"2026-05-09T17:05:44Z","title":"Evaluating LLM-Generated Code: A Benchmark and Developer Study","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T22:55:49.377456Z"},"links":{"cited_paper":"/paper/1808.09588","citing_paper":"/paper/2605.09059"},"observation_digest":"sha256:ed9ee6bb95efd26b2a9ed8db81cfba2aeabe1f84115a9e57e2eb56c0c3aff91a","observation_id":"89f2bcf6-def9-438e-902a-6baa08435917","resolution":{"observed_at":"2026-07-01T13:35:46.796290Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-08-12T14:56:35.025839Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":"2310.06770","doi":"10.1145/512927.512945","metadata_source":"pith","pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","venue":"cs.CL","work_id":"d0effe15-a689-441a-8e3f-ea35f1c4e4b1","year":2023},"citing_paper":{"arxiv_id":"2605.09059","last_updated":"2026-06-09T18:21:19Z","snapshot_observed_at":"2026-07-06T23:21:11.475005Z","submitted_at":"2026-05-09T17:05:44Z","title":"Evaluating LLM-Generated Code: A Benchmark and Developer Study","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T22:55:49.377456Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2605.09059"},"observation_digest":"sha256:3ed1cb6a233faf383c12527853dd72874b02cae89e059014c4217e9870efaa10","observation_id":"2b046d03-c903-4df3-bb30-a480c0342ff2","resolution":{"observed_at":"2026-07-01T13:35:46.793435Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-12T18:11:04.754824Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2605.09059","last_updated":"2026-06-09T18:21:19Z","snapshot_observed_at":"2026-07-06T23:21:11.475005Z","submitted_at":"2026-05-09T17:05:44Z","title":"Evaluating LLM-Generated Code: A Benchmark and Developer Study","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T22:55:49.377456Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2605.09059"},"observation_digest":"sha256:9891e6b5bf9fa8d9bb49bac6ac870c61382164cce72d81d1c672b4d74e4d7a01","observation_id":"cacf0642-5b7b-4c18-9d8d-cc6fc6eec3a1","resolution":{"observed_at":"2026-07-01T13:35:46.788186Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03091","last_updated":"2023-10-04T01:13:49Z","snapshot_observed_at":"2026-08-13T16:44:59.404632Z","submitted_at":"2023-06-05T17:59:41Z","title":"RepoBench: Benchmarking Repository-Level Code Auto-Completion Systems","version":2},"cited_work":{"arxiv_id":"2306.03091","doi":"10.48550/arxiv.2306.03091","metadata_source":"pith","pith_arxiv_id":"2306.03091","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RepoBench: Benchmarking Repository-Level Code Auto-Completion Systems","venue":"cs.CL","work_id":"24b24ba5-b21c-43c6-866f-4b874305372e","year":2023},"citing_paper":{"arxiv_id":"2605.09059","last_updated":"2026-06-09T18:21:19Z","snapshot_observed_at":"2026-07-06T23:21:11.475005Z","submitted_at":"2026-05-09T17:05:44Z","title":"Evaluating LLM-Generated Code: A Benchmark and Developer Study","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T22:55:49.377456Z"},"links":{"cited_paper":"/paper/2306.03091","citing_paper":"/paper/2605.09059"},"observation_digest":"sha256:a0f5ed3761df83aa1503ed4e7d53f179337de9a2685cbec30d0c46c1aec31382","observation_id":"fe160874-8e8e-4a3a-b6a2-43b1ad12a4b1","resolution":{"observed_at":"2026-07-01T13:35:46.790813Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-21T21:53:10.253516+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T21:53:10.253516+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1554.370187","doi":"10.1145/3641554.3701872","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":null,"work_id":"742358c0-12cf-4e64-8649-6f4793bc6d52","year":2025},"citing_paper":{"arxiv_id":"2605.09059","last_updated":"2026-06-09T18:21:19Z","snapshot_observed_at":"2026-07-06T23:21:11.475005Z","submitted_at":"2026-05-09T17:05:44Z","title":"Evaluating LLM-Generated Code: A Benchmark and Developer Study","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T22:55:49.377456Z"},"links":{"citing_paper":"/paper/2605.09059"},"observation_digest":"sha256:e89772d0c6271a161bcc6130f0d4ff88bba7c694473c388297705468dc8f4f87","observation_id":"eb790eb8-54f5-4a2f-a241-1ca8858310ef","resolution":{"observed_at":"2026-06-30T23:05:06.697378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2860.2024","doi":"10.1109/aitest62860.2024.00019","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":null,"work_id":"f751e13e-b606-4504-aac8-d91f2c7c8c13","year":2024},"citing_paper":{"arxiv_id":"2605.09059","last_updated":"2026-06-09T18:21:19Z","snapshot_observed_at":"2026-07-06T23:21:11.475005Z","submitted_at":"2026-05-09T17:05:44Z","title":"Evaluating LLM-Generated Code: A Benchmark and Developer Study","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T22:55:49.377456Z"},"links":{"citing_paper":"/paper/2605.09059"},"observation_digest":"sha256:eaefcae4ae1e3f9bcd3afa6274e6eee39187bb8123d7caf48242ae2066c1da50","observation_id":"a8410229-2d97-43c4-8988-e9103464f083","resolution":{"observed_at":"2026-06-30T23:05:06.700633Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T12:23:48.901963Z","title":"2025.Homepage | SonarQube Cloud | Sonar Documentation","venue":null,"work_id":"fe511d48-f985-414e-b9b8-c47945f4801e","year":2025},"citing_paper":{"arxiv_id":"2605.09059","last_updated":"2026-06-09T18:21:19Z","snapshot_observed_at":"2026-07-06T23:21:11.475005Z","submitted_at":"2026-05-09T17:05:44Z","title":"Evaluating LLM-Generated Code: A Benchmark and Developer Study","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T22:55:49.377456Z"},"links":{"citing_paper":"/paper/2605.09059"},"observation_digest":"sha256:d37f2d92cd924ebbcc365a74df3869db6aa0071939ba14afab78e2280dd22461","observation_id":"0025d0a0-b272-4444-86a4-1a5cb2296a60","resolution":{"observed_at":"2026-07-07T12:23:48.903665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T12:23:48.904237Z","title":"2025.Software qualities | SonarQube Cloud Documentation","venue":null,"work_id":"951a2a04-c12a-4203-b3ce-df3567a02643","year":2025},"citing_paper":{"arxiv_id":"2605.09059","last_updated":"2026-06-09T18:21:19Z","snapshot_observed_at":"2026-07-06T23:21:11.475005Z","submitted_at":"2026-05-09T17:05:44Z","title":"Evaluating LLM-Generated Code: A Benchmark and Developer Study","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T22:55:49.377456Z"},"links":{"citing_paper":"/paper/2605.09059"},"observation_digest":"sha256:6473f74a500df26d27635e5c3f517f5283c661b94d82bb5f5725d879049d75da","observation_id":"db7bf431-6895-415d-bcb9-3e6dba8af913","resolution":{"observed_at":"2026-07-07T12:23:48.905912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T12:23:48.897298Z","title":"2026.Evaluating LLM-Generated Code: Benchmarking on complex assignment","venue":null,"work_id":"1e99b77e-c38c-40c2-b59c-4e55eda0e7f2","year":2026},"citing_paper":{"arxiv_id":"2605.09059","last_updated":"2026-06-09T18:21:19Z","snapshot_observed_at":"2026-07-06T23:21:11.475005Z","submitted_at":"2026-05-09T17:05:44Z","title":"Evaluating LLM-Generated Code: A Benchmark and Developer Study","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T22:55:49.377456Z"},"links":{"citing_paper":"/paper/2605.09059"},"observation_digest":"sha256:2ef750078e8aab16af227335c9a8339ff44aeafa470aacb559026e3a79881fbd","observation_id":"1e5a5a2e-0bce-44f4-a776-8dd1f92558a8","resolution":{"observed_at":"2026-07-07T12:23:48.899190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T12:23:48.894868Z","title":"2026.Evaluating LLM-Generated Code: Developer Study","venue":null,"work_id":"bd32d036-c9ba-4291-8e55-1be95cae133c","year":2026},"citing_paper":{"arxiv_id":"2605.09059","last_updated":"2026-06-09T18:21:19Z","snapshot_observed_at":"2026-07-06T23:21:11.475005Z","submitted_at":"2026-05-09T17:05:44Z","title":"Evaluating LLM-Generated Code: A Benchmark and Developer Study","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T22:55:49.377456Z"},"links":{"citing_paper":"/paper/2605.09059"},"observation_digest":"sha256:72a403937fcceb7e46726100df57bd4afdb9358291945c19c2b5fe0f140d8d5e","observation_id":"d95a9970-f9e1-47e9-ae78-eaf4f8a18da4","resolution":{"observed_at":"2026-07-07T12:23:48.896553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T12:23:48.906643Z","title":"2025.Building The Tree of Life from Scratch","venue":null,"work_id":"1877c3c1-9b38-4cbc-8da2-85332b776487","year":2025},"citing_paper":{"arxiv_id":"2605.09059","last_updated":"2026-06-09T18:21:19Z","snapshot_observed_at":"2026-07-06T23:21:11.475005Z","submitted_at":"2026-05-09T17:05:44Z","title":"Evaluating LLM-Generated Code: A Benchmark and Developer Study","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T22:55:49.377456Z"},"links":{"citing_paper":"/paper/2605.09059"},"observation_digest":"sha256:dc80c33306bf9a322d52cc2ad8831d7845351d7fa48d336050ec2cbccd12a217","observation_id":"14f43bf3-7144-4d2a-819d-2c0d495bce81","resolution":{"observed_at":"2026-07-07T12:23:48.908516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3728963","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URLhttps://doi.org/10.1145/3728963","venue":"Proceedings of the ACM on software engineering.","work_id":"6e1184d8-f0da-4535-a9ae-bc796536a28e","year":2025},"citing_paper":{"arxiv_id":"2605.09059","last_updated":"2026-06-09T18:21:19Z","snapshot_observed_at":"2026-07-06T23:21:11.475005Z","submitted_at":"2026-05-09T17:05:44Z","title":"Evaluating LLM-Generated Code: A Benchmark and Developer Study","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T22:55:49.377456Z"},"links":{"citing_paper":"/paper/2605.09059"},"observation_digest":"sha256:cdd1851264c63145a698e500478ccc9bb6df9534c2e8ecdf4dffc24826d4f9a4","observation_id":"3b30561b-8c93-4f2e-ad70-9a1500715ace","resolution":{"observed_at":"2026-06-30T23:05:06.694698Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3643758","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Proceedings of the ACM on software engineering.","work_id":"ad428606-d7e2-413f-9197-56c2552ad0c5","year":2024},"citing_paper":{"arxiv_id":"2605.09059","last_updated":"2026-06-09T18:21:19Z","snapshot_observed_at":"2026-07-06T23:21:11.475005Z","submitted_at":"2026-05-09T17:05:44Z","title":"Evaluating LLM-Generated Code: A Benchmark and Developer Study","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T22:55:49.377456Z"},"links":{"citing_paper":"/paper/2605.09059"},"observation_digest":"sha256:16da56a05b67efa7d714dc9e9471602fb67420f8c68ee0215516e7473ed863de","observation_id":"b50b43ce-c120-4f84-82d3-e54e4de422ff","resolution":{"observed_at":"2026-06-30T23:05:06.706074Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7503.362331","doi":"10.1145/3597503.3623310","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Available: https://doi.org/10.1145/3597503.3623316","venue":null,"work_id":"c2e0996f-6d46-4086-a320-461f0657e916","year":2024},"citing_paper":{"arxiv_id":"2605.09059","last_updated":"2026-06-09T18:21:19Z","snapshot_observed_at":"2026-07-06T23:21:11.475005Z","submitted_at":"2026-05-09T17:05:44Z","title":"Evaluating LLM-Generated Code: A Benchmark and Developer Study","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T22:55:49.377456Z"},"links":{"citing_paper":"/paper/2605.09059"},"observation_digest":"sha256:2b1a6f88e8181a9c7ac70d6a7e8c30b305787c212c3c271c3ed2e2fa39338528","observation_id":"dfc8c545-533c-4b3f-ba39-f3f366af027d","resolution":{"observed_at":"2026-06-30T23:05:06.711359Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.emnlp-main.151","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Repocoder: Repository-level code completion through iterative retrieval and generation","venue":null,"work_id":"91af41bc-747c-4961-bcd6-6e95a294026b","year":2023},"citing_paper":{"arxiv_id":"2605.09059","last_updated":"2026-06-09T18:21:19Z","snapshot_observed_at":"2026-07-06T23:21:11.475005Z","submitted_at":"2026-05-09T17:05:44Z","title":"Evaluating LLM-Generated Code: A Benchmark and Developer Study","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T22:55:49.377456Z"},"links":{"citing_paper":"/paper/2605.09059"},"observation_digest":"sha256:c5ace472083c41d66acb37cace187887ba5d520e4ca1d5f9eec9425e7e46b58c","observation_id":"638025d0-ebd4-4cb3-8444-8adcc56e8c97","resolution":{"observed_at":"2026-06-30T23:05:06.708072Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:45.105789+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:45.105789+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":"2306.05685","doi":"10.1109/4235.797969","metadata_source":"pith","pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","venue":"cs.CL","work_id":"d0c30cd7-81e1-4159-a87f-f6adca77ff08","year":2023},"citing_paper":{"arxiv_id":"2605.09059","last_updated":"2026-06-09T18:21:19Z","snapshot_observed_at":"2026-07-06T23:21:11.475005Z","submitted_at":"2026-05-09T17:05:44Z","title":"Evaluating LLM-Generated Code: A Benchmark and Developer Study","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T22:55:49.377456Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2605.09059"},"observation_digest":"sha256:0beaec309ae89bad8f7afabcdb1b2bc57b872fefaf86e747709047341089da36","observation_id":"8fce7454-f870-4b31-a362-2c52a31330b7","resolution":{"observed_at":"2026-07-01T13:35:46.798946Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17568","last_updated":"2024-07-10T03:52:58Z","snapshot_observed_at":"2026-08-14T08:57:49.577104Z","submitted_at":"2023-03-30T17:34:01Z","title":"CodeGeeX: A Pre-Trained Model for Code Generation with Multilingual Benchmarking on HumanEval-X","version":2},"cited_work":{"arxiv_id":"2303.17568","doi":"10.48550/arxiv.2303.17568","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.17568","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zheng, X","venue":"arXiv (Cornell University)","work_id":"a437deb4-3fce-40c1-ab5b-0bfcb78d4e75","year":2023},"citing_paper":{"arxiv_id":"2605.09059","last_updated":"2026-06-09T18:21:19Z","snapshot_observed_at":"2026-07-06T23:21:11.475005Z","submitted_at":"2026-05-09T17:05:44Z","title":"Evaluating LLM-Generated Code: A Benchmark and Developer Study","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T22:55:49.377456Z"},"links":{"cited_paper":"/paper/2303.17568","citing_paper":"/paper/2605.09059"},"observation_digest":"sha256:ed5b1fa08042a08ecd4726f4b80cca9022d3e45ee9ccdb138e4922a573cce59d","observation_id":"1a43b0bd-2abc-460e-a5f7-7e7be53f3465","resolution":{"observed_at":"2026-07-01T13:35:46.785333Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.09059","last_updated":"2026-06-09T18:21:19Z","latest_version":2,"primary_category":"cs.SE","snapshot_observed_at":"2026-07-06T23:21:11.475005Z","submitted_at":"2026-05-09T17:05:44Z","title":"Evaluating LLM-Generated Code: A Benchmark and Developer Study"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":0,"verified_exact":12,"verified_fuzzy":6},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2605.09059."}