{"as_of":"2026-08-08T01:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a043a572aa4fd1a0eb5fd4bdece5e4557a1d8fa8fc02fe696763775454a4b501","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":25,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:49:28.357077Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":9,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.16498","last_updated":"2025-03-04T09:13:23Z","snapshot_observed_at":"2026-08-02T17:19:49.137620Z","submitted_at":"2024-08-29T12:56:06Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","version":2},"cited_work":{"arxiv_id":"2408.16498","doi":"10.48550/arxiv.2408.16498","metadata_source":"pith","pith_arxiv_id":"2408.16498","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","venue":"cs.SE","work_id":"dabfce49-50dd-4c91-a178-503523faeaeb","year":2024},"citing_paper":{"arxiv_id":"2503.17181","last_updated":"2026-04-08T09:48:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T14:29:35Z","title":"A Study of LLMs' Preferences for Libraries and Programming Languages","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T22:53:16.951417Z"},"links":{"cited_paper":"/paper/2408.16498","citing_paper":"/paper/2503.17181"},"observation_digest":"sha256:f226dc1c78bf3fbf61d8eda25977e5e8026b724e8578e12d629f3d56de6fc1ab","observation_id":"58a63251-dcd7-4788-9ef4-8bb4a215dfd2","resolution":{"observed_at":"2026-05-22T22:55:12.174917Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16498","last_updated":"2025-03-04T09:13:23Z","snapshot_observed_at":"2026-08-02T17:19:49.137620Z","submitted_at":"2024-08-29T12:56:06Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16498","snapshot_observed_at":"2026-08-07T14:49:28.357077Z","title":"A survey on evaluating large language models in code generation tasks.arXiv preprint arXiv:2408.16498, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17481","last_updated":"2025-05-23T05:21:11Z","snapshot_observed_at":"2026-08-07T21:56:32.010090Z","submitted_at":"2025-05-23T05:21:11Z","title":"MARCO: Meta-Reflection with Cross-Referencing for Code Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:28.357077Z"},"links":{"cited_paper":"/paper/2408.16498","citing_paper":"/paper/2505.17481"},"observation_digest":"sha256:4a5016cd718f6b03032edafcfaae5ab424852146d3d51f1587f3d9439fc82e1b","observation_id":"73c7a981-8762-408f-b495-6468474bb5cb","resolution":{"observed_at":"2026-08-07T14:49:28.357077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16498","last_updated":"2025-03-04T09:13:23Z","snapshot_observed_at":"2026-08-02T17:19:49.137620Z","submitted_at":"2024-08-29T12:56:06Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16498","snapshot_observed_at":"2026-08-07T14:15:46.078482Z","title":"A survey on evaluating large language models in code generation tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19443","last_updated":"2025-05-26T03:00:21Z","snapshot_observed_at":"2026-08-07T14:11:48.229560Z","submitted_at":"2025-05-26T03:00:21Z","title":"Vibe Coding vs. Agentic Coding: Fundamentals and Practical Implications of Agentic AI","version":1},"reference_index":139,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:46.078482Z"},"links":{"cited_paper":"/paper/2408.16498","citing_paper":"/paper/2505.19443"},"observation_digest":"sha256:e57d0c0781ead4ec480afdb858e7274f1b34efdb41c214d23d969359b118fd1b","observation_id":"3b67ef2e-6790-42c4-b09b-8d6d85efc8dc","resolution":{"observed_at":"2026-08-07T14:15:46.078482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16498","last_updated":"2025-03-04T09:13:23Z","snapshot_observed_at":"2026-08-02T17:19:49.137620Z","submitted_at":"2024-08-29T12:56:06Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16498","snapshot_observed_at":"2026-08-07T05:27:50.065829Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07818","last_updated":"2025-06-09T14:46:02Z","snapshot_observed_at":"2026-08-07T21:48:41.764042Z","submitted_at":"2025-06-09T14:46:02Z","title":"WebUIBench: A Comprehensive Benchmark for Evaluating Multimodal Large Language Models in WebUI-to-Code","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.065829Z"},"links":{"cited_paper":"/paper/2408.16498","citing_paper":"/paper/2506.07818"},"observation_digest":"sha256:a5e1e7ffc74997a92f8364fc9d822ea78095926d7e91d59a86bb6b27c0f636a2","observation_id":"28a1da4d-8a62-400f-b4f3-171e136d64d8","resolution":{"observed_at":"2026-08-07T05:27:50.065829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16498","last_updated":"2025-03-04T09:13:23Z","snapshot_observed_at":"2026-08-02T17:19:49.137620Z","submitted_at":"2024-08-29T12:56:06Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16498","snapshot_observed_at":"2026-08-07T10:17:26.591222Z","title":"A survey on evaluating large language models in code generation tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.591222Z"},"links":{"cited_paper":"/paper/2408.16498","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:0efafd488cbc3d309ec476e116f5247e0bfbbe7ef93b83a7cad6bb343572719f","observation_id":"794a941e-1db0-4fa3-8c6f-cdc41b73ba3e","resolution":{"observed_at":"2026-08-07T10:17:26.591222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16498","last_updated":"2025-03-04T09:13:23Z","snapshot_observed_at":"2026-08-02T17:19:49.137620Z","submitted_at":"2024-08-29T12:56:06Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16498","snapshot_observed_at":"2026-08-06T21:16:41.365515Z","title":"A survey on evaluating large language models in code generation tasks,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-07T16:26:19.433573Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.365515Z"},"links":{"cited_paper":"/paper/2408.16498","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:c35c961c4e221aedb8608e0f5728e754c0e853f994f8fb6361ea22b2d6b87d3e","observation_id":"3bc9bdaa-f0df-4836-91cb-e64f7b267922","resolution":{"observed_at":"2026-08-06T21:16:41.365515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16498","last_updated":"2025-03-04T09:13:23Z","snapshot_observed_at":"2026-08-02T17:19:49.137620Z","submitted_at":"2024-08-29T12:56:06Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16498","snapshot_observed_at":"2026-08-06T19:18:57.264731Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05962","last_updated":"2025-07-08T13:10:32Z","snapshot_observed_at":"2026-08-06T19:11:51.382282Z","submitted_at":"2025-07-08T13:10:32Z","title":"Evaluation of Large Language Model-Driven AutoML in Data and Model Management from Human-Centered Perspective","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:18:57.264731Z"},"links":{"cited_paper":"/paper/2408.16498","citing_paper":"/paper/2507.05962"},"observation_digest":"sha256:16785925ca5b00efd1e11374e75360958678b0bca19884638dfdcf43e943c3e8","observation_id":"9b86d62f-6e14-4437-b0f7-be90c207908b","resolution":{"observed_at":"2026-08-06T19:18:57.264731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16498","last_updated":"2025-03-04T09:13:23Z","snapshot_observed_at":"2026-08-02T17:19:49.137620Z","submitted_at":"2024-08-29T12:56:06Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16498","snapshot_observed_at":"2026-08-06T13:39:48.434745Z","title":"A survey on evaluating large language models in code generation tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20402","last_updated":"2026-08-03T02:50:12Z","snapshot_observed_at":"2026-08-06T23:27:49.763320Z","submitted_at":"2025-07-27T19:51:37Z","title":"CIgrate: Automating CI Service Migration with Large Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:48.434745Z"},"links":{"cited_paper":"/paper/2408.16498","citing_paper":"/paper/2507.20402"},"observation_digest":"sha256:f6da499f3e76f63d2132c7e59143308f7e5ddae53cf431f159dcd193796af463","observation_id":"bd44c6f3-ecca-4d4e-ac0e-f6ae2a08d05f","resolution":{"observed_at":"2026-08-06T13:39:48.434745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16498","last_updated":"2025-03-04T09:13:23Z","snapshot_observed_at":"2026-08-02T17:19:49.137620Z","submitted_at":"2024-08-29T12:56:06Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16498","snapshot_observed_at":"2026-08-04T17:07:43.607070Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11132","last_updated":"2026-06-24T01:18:39Z","snapshot_observed_at":"2026-08-04T17:07:41.058487Z","submitted_at":"2025-09-14T06:56:47Z","title":"Rethinking Technology Stack Selection with AI Coding Proficiency","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T17:07:43.607070Z"},"links":{"cited_paper":"/paper/2408.16498","citing_paper":"/paper/2509.11132"},"observation_digest":"sha256:52583c2bea60e9d26264d949184bcc74fdca81979df8214ccecb20af205ab0bb","observation_id":"29e1aff2-75d2-47e1-9d3b-26e46f87d92d","resolution":{"observed_at":"2026-08-04T17:07:43.607070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16498","last_updated":"2025-03-04T09:13:23Z","snapshot_observed_at":"2026-08-02T17:19:49.137620Z","submitted_at":"2024-08-29T12:56:06Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","version":2},"cited_work":{"arxiv_id":"2408.16498","doi":"10.48550/arxiv.2408.16498","metadata_source":"pith","pith_arxiv_id":"2408.16498","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","venue":"cs.SE","work_id":"dabfce49-50dd-4c91-a178-503523faeaeb","year":2024},"citing_paper":{"arxiv_id":"2509.22202","last_updated":"2026-05-19T08:31:44Z","snapshot_observed_at":"2026-08-02T09:19:07.881094Z","submitted_at":"2025-09-26T11:14:38Z","title":"Library Hallucinations in LLM-Generated Code: A Risk Analysis Grounded in Developer Queries","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-21T22:31:20.358758Z"},"links":{"cited_paper":"/paper/2408.16498","citing_paper":"/paper/2509.22202"},"observation_digest":"sha256:4f1af9a020b532ae025ec2712ea63420afccf2b8bd62795776535626d3085106","observation_id":"70e86167-3ef9-40d7-ba54-f8481c8985b8","resolution":{"observed_at":"2026-05-21T22:34:23.698211Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16498","last_updated":"2025-03-04T09:13:23Z","snapshot_observed_at":"2026-08-02T17:19:49.137620Z","submitted_at":"2024-08-29T12:56:06Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","version":2},"cited_work":{"arxiv_id":"2408.16498","doi":"10.48550/arxiv.2408.16498","metadata_source":"pith","pith_arxiv_id":"2408.16498","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","venue":"cs.SE","work_id":"dabfce49-50dd-4c91-a178-503523faeaeb","year":2024},"citing_paper":{"arxiv_id":"2603.00989","last_updated":"2026-04-13T21:30:35Z","snapshot_observed_at":"2026-07-06T22:47:24.369805Z","submitted_at":"2026-03-01T08:32:36Z","title":"Sustainable Code Generation Using Large Language Models: A Systematic Literature Review","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-15T18:49:01.097179Z"},"links":{"cited_paper":"/paper/2408.16498","citing_paper":"/paper/2603.00989"},"observation_digest":"sha256:7ed4d924210b25237e8916bc509e76bc21dae583e86864712dd7eab6eabad1a5","observation_id":"6d148974-2d34-4eb6-a86d-94d87adc80a9","resolution":{"observed_at":"2026-05-15T18:50:16.475540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16498","last_updated":"2025-03-04T09:13:23Z","snapshot_observed_at":"2026-08-02T17:19:49.137620Z","submitted_at":"2024-08-29T12:56:06Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","version":2},"cited_work":{"arxiv_id":"2408.16498","doi":"10.48550/arxiv.2408.16498","metadata_source":"pith","pith_arxiv_id":"2408.16498","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","venue":"cs.SE","work_id":"dabfce49-50dd-4c91-a178-503523faeaeb","year":2024},"citing_paper":{"arxiv_id":"2604.06742","last_updated":"2026-07-17T08:33:08Z","snapshot_observed_at":"2026-08-03T21:08:28.866048Z","submitted_at":"2026-04-08T07:09:10Z","title":"Evaluating LLM-Based 0-to-1 Software Generation in End-to-End CLI Tool Scenarios","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T18:35:03.746555Z"},"links":{"cited_paper":"/paper/2408.16498","citing_paper":"/paper/2604.06742"},"observation_digest":"sha256:bde933621a104c67bff7925227c15c2146c848db86c8fd5ac5e374f39ad10c07","observation_id":"1307cc67-2121-4df9-98f5-2c49b7f36862","resolution":{"observed_at":"2026-05-10T18:35:42.457281Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16498","last_updated":"2025-03-04T09:13:23Z","snapshot_observed_at":"2026-08-02T17:19:49.137620Z","submitted_at":"2024-08-29T12:56:06Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16498","snapshot_observed_at":"2026-08-02T16:42:13.327116Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.06742","last_updated":"2026-07-17T08:33:08Z","snapshot_observed_at":"2026-08-03T21:08:28.866048Z","submitted_at":"2026-04-08T07:09:10Z","title":"Evaluating LLM-Based 0-to-1 Software Generation in End-to-End CLI Tool Scenarios","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T16:42:13.327116Z"},"links":{"cited_paper":"/paper/2408.16498","citing_paper":"/paper/2604.06742"},"observation_digest":"sha256:0cd1a2e9e31dba473f4ec9b17d1e9c09201bcc2a75715a11a58250befd1fef4d","observation_id":"d979dbcb-b38f-4977-b0d5-73b14d51a5d4","resolution":{"observed_at":"2026-08-02T16:42:13.327116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16498","last_updated":"2025-03-04T09:13:23Z","snapshot_observed_at":"2026-08-02T17:19:49.137620Z","submitted_at":"2024-08-29T12:56:06Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","version":2},"cited_work":{"arxiv_id":"2408.16498","doi":"10.48550/arxiv.2408.16498","metadata_source":"pith","pith_arxiv_id":"2408.16498","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","venue":"cs.SE","work_id":"dabfce49-50dd-4c91-a178-503523faeaeb","year":2024},"citing_paper":{"arxiv_id":"2604.09515","last_updated":"2026-04-10T17:37:26Z","snapshot_observed_at":"2026-07-31T08:47:34.578914Z","submitted_at":"2026-04-10T17:37:26Z","title":"When LLMs Lag Behind: Knowledge Conflicts from Evolving APIs in Code Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T16:48:11.705307Z"},"links":{"cited_paper":"/paper/2408.16498","citing_paper":"/paper/2604.09515"},"observation_digest":"sha256:26df270399906141f4738d92f0fe077ed5b56c8dfa759f990a6569280dc24f8f","observation_id":"0f744cc3-4b5c-4133-8937-b6b1320ac142","resolution":{"observed_at":"2026-05-11T08:11:01.515692Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16498","last_updated":"2025-03-04T09:13:23Z","snapshot_observed_at":"2026-08-02T17:19:49.137620Z","submitted_at":"2024-08-29T12:56:06Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","version":2},"cited_work":{"arxiv_id":"2408.16498","doi":"10.48550/arxiv.2408.16498","metadata_source":"pith","pith_arxiv_id":"2408.16498","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","venue":"cs.SE","work_id":"dabfce49-50dd-4c91-a178-503523faeaeb","year":2024},"citing_paper":{"arxiv_id":"2604.24621","last_updated":"2026-04-27T15:51:22Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:51:22Z","title":"Evaluation of LLM-Based Software Engineering Tools: Practices, Challenges, and Future Directions","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T02:52:55.120013Z"},"links":{"cited_paper":"/paper/2408.16498","citing_paper":"/paper/2604.24621"},"observation_digest":"sha256:99dc242c0551e2f03036089299bfdb192b569b72de373ebee9f4a4b4a8cb6a9e","observation_id":"dff3068f-f048-4f86-845d-7308681cc812","resolution":{"observed_at":"2026-05-11T22:21:52.985054Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16498","last_updated":"2025-03-04T09:13:23Z","snapshot_observed_at":"2026-08-02T17:19:49.137620Z","submitted_at":"2024-08-29T12:56:06Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","version":2},"cited_work":{"arxiv_id":"2408.16498","doi":"10.48550/arxiv.2408.16498","metadata_source":"pith","pith_arxiv_id":"2408.16498","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","venue":"cs.SE","work_id":"dabfce49-50dd-4c91-a178-503523faeaeb","year":2024},"citing_paper":{"arxiv_id":"2604.24678","last_updated":"2026-04-27T16:38:01Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T16:38:01Z","title":"Leveraging LLMs for Multi-File DSL Code Generation: An Industrial Case Study","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-08T02:49:14.533263Z"},"links":{"cited_paper":"/paper/2408.16498","citing_paper":"/paper/2604.24678"},"observation_digest":"sha256:58aa823a6024203f018492833c2561cb8531c1866532a357c68ed290ce0926d6","observation_id":"c11e77b1-a70f-4c26-ac52-016eac86f864","resolution":{"observed_at":"2026-05-11T22:26:13.447868Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16498","last_updated":"2025-03-04T09:13:23Z","snapshot_observed_at":"2026-08-02T17:19:49.137620Z","submitted_at":"2024-08-29T12:56:06Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","version":2},"cited_work":{"arxiv_id":"2408.16498","doi":"10.48550/arxiv.2408.16498","metadata_source":"pith","pith_arxiv_id":"2408.16498","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","venue":"cs.SE","work_id":"dabfce49-50dd-4c91-a178-503523faeaeb","year":2024},"citing_paper":{"arxiv_id":"2604.27001","last_updated":"2026-04-29T03:58:55Z","snapshot_observed_at":"2026-07-06T23:12:33.898150Z","submitted_at":"2026-04-29T03:58:55Z","title":"An Empirical Security Evaluation of LLM-Generated Cryptographic Rust Code","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-07T13:26:17.100399Z"},"links":{"cited_paper":"/paper/2408.16498","citing_paper":"/paper/2604.27001"},"observation_digest":"sha256:f9869635e739b3381f40ce6edc86da2604ba6a66eae2f04e702bf2e8754d7658","observation_id":"179bd47b-4d3c-4d7a-b1a3-307365621512","resolution":{"observed_at":"2026-05-12T08:56:26.782309Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16498","last_updated":"2025-03-04T09:13:23Z","snapshot_observed_at":"2026-08-02T17:19:49.137620Z","submitted_at":"2024-08-29T12:56:06Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","version":2},"cited_work":{"arxiv_id":"2408.16498","doi":"10.48550/arxiv.2408.16498","metadata_source":"pith","pith_arxiv_id":"2408.16498","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","venue":"cs.SE","work_id":"dabfce49-50dd-4c91-a178-503523faeaeb","year":2024},"citing_paper":{"arxiv_id":"2605.05267","last_updated":"2026-05-06T09:38:31Z","snapshot_observed_at":"2026-08-04T17:41:12.164736Z","submitted_at":"2026-05-06T09:38:31Z","title":"Bridging Generation and Training: A Systematic Review of Quality Issues in LLMs for Code","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T17:37:51.790000Z"},"links":{"cited_paper":"/paper/2408.16498","citing_paper":"/paper/2605.05267"},"observation_digest":"sha256:53fd3dfa0a4c601ef81c916de3746179a4818cfec0a84b16a8485f4f0d7273f6","observation_id":"1fc82384-6a5f-4bc2-af0c-a9d46c474e89","resolution":{"observed_at":"2026-05-11T17:21:11.078592Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16498","last_updated":"2025-03-04T09:13:23Z","snapshot_observed_at":"2026-08-02T17:19:49.137620Z","submitted_at":"2024-08-29T12:56:06Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","version":2},"cited_work":{"arxiv_id":"2408.16498","doi":"10.48550/arxiv.2408.16498","metadata_source":"pith","pith_arxiv_id":"2408.16498","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","venue":"cs.SE","work_id":"dabfce49-50dd-4c91-a178-503523faeaeb","year":2024},"citing_paper":{"arxiv_id":"2605.17957","last_updated":"2026-05-18T07:12:14Z","snapshot_observed_at":"2026-07-06T23:28:55.079333Z","submitted_at":"2026-05-18T07:12:14Z","title":"Contextualized Code Pretraining for Code Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T09:36:15.468902Z"},"links":{"cited_paper":"/paper/2408.16498","citing_paper":"/paper/2605.17957"},"observation_digest":"sha256:28170a7d366b2ef067d878ce0e3ce04e4594d4bc43982dcc9a1aaceef3a95ea4","observation_id":"02537f36-3b2a-42e7-a1e8-21cbf4040725","resolution":{"observed_at":"2026-05-20T09:38:10.829807Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16498","last_updated":"2025-03-04T09:13:23Z","snapshot_observed_at":"2026-08-02T17:19:49.137620Z","submitted_at":"2024-08-29T12:56:06Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","version":2},"cited_work":{"arxiv_id":"2408.16498","doi":"10.48550/arxiv.2408.16498","metadata_source":"pith","pith_arxiv_id":"2408.16498","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","venue":"cs.SE","work_id":"dabfce49-50dd-4c91-a178-503523faeaeb","year":2024},"citing_paper":{"arxiv_id":"2605.29822","last_updated":"2026-05-28T12:04:51Z","snapshot_observed_at":"2026-07-29T16:18:16.189748Z","submitted_at":"2026-05-28T12:04:51Z","title":"Inferring Code Correctness from Specification","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T06:33:36.835860Z"},"links":{"cited_paper":"/paper/2408.16498","citing_paper":"/paper/2605.29822"},"observation_digest":"sha256:e473e97ba3fdbd03da5fc6f8ed6127210d8807697c0e156caa589bcaad4304c0","observation_id":"d29147dc-ee30-48b2-8434-2cf3b772f042","resolution":{"observed_at":"2026-06-29T14:33:31.547450Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16498","last_updated":"2025-03-04T09:13:23Z","snapshot_observed_at":"2026-08-02T17:19:49.137620Z","submitted_at":"2024-08-29T12:56:06Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","version":2},"cited_work":{"arxiv_id":"2408.16498","doi":"10.48550/arxiv.2408.16498","metadata_source":"pith","pith_arxiv_id":"2408.16498","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","venue":"cs.SE","work_id":"dabfce49-50dd-4c91-a178-503523faeaeb","year":2024},"citing_paper":{"arxiv_id":"2606.09852","last_updated":"2026-05-11T11:17:58Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-05-11T11:17:58Z","title":"LLM-Based Code Documentation Generation and Multi-Judge Evaluation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T22:38:55.804639Z"},"links":{"cited_paper":"/paper/2408.16498","citing_paper":"/paper/2606.09852"},"observation_digest":"sha256:07840bb0f38c809f4d01d24450e08196f4f3409006aa5be64ad68d6e507014f9","observation_id":"a2c76825-01b9-4849-a316-7590d42e7ff8","resolution":{"observed_at":"2026-07-01T13:55:45.140465Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16498","last_updated":"2025-03-04T09:13:23Z","snapshot_observed_at":"2026-08-02T17:19:49.137620Z","submitted_at":"2024-08-29T12:56:06Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","version":2},"cited_work":{"arxiv_id":"2408.16498","doi":"10.48550/arxiv.2408.16498","metadata_source":"pith","pith_arxiv_id":"2408.16498","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","venue":"cs.SE","work_id":"dabfce49-50dd-4c91-a178-503523faeaeb","year":2024},"citing_paper":{"arxiv_id":"2606.20146","last_updated":"2026-06-23T06:59:35Z","snapshot_observed_at":"2026-08-02T14:55:45.385540Z","submitted_at":"2026-06-18T12:08:04Z","title":"BIM-Edit: Benchmarking Large Language Models for IFC-Based Building Information Modeling","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T17:41:23.922715Z"},"links":{"cited_paper":"/paper/2408.16498","citing_paper":"/paper/2606.20146"},"observation_digest":"sha256:0a64c7b2a6539f7c4f2a39e6f731204619e43a97dd5e20dee8ae0a76a758c3e4","observation_id":"1539c3cc-ffb3-4493-958c-66ee305803a5","resolution":{"observed_at":"2026-07-04T03:49:29.732057Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16498","last_updated":"2025-03-04T09:13:23Z","snapshot_observed_at":"2026-08-02T17:19:49.137620Z","submitted_at":"2024-08-29T12:56:06Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16498","snapshot_observed_at":"2026-07-12T04:21:23.867336Z","title":"A survey on evaluating large language models in code generation tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03174","last_updated":"2026-07-03T10:13:59Z","snapshot_observed_at":"2026-08-06T11:21:35.084733Z","submitted_at":"2026-07-03T10:13:59Z","title":"Effectiveness of LLM-based Software Diversity for Reliability Improvement -- an Empirical Study","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T04:21:23.867336Z"},"links":{"cited_paper":"/paper/2408.16498","citing_paper":"/paper/2607.03174"},"observation_digest":"sha256:5f78e9eb38607f5f26470dfffc0ef63c22266c9468857224f4579a7306b716e3","observation_id":"ade76ee1-a86e-4feb-a2c4-7a3e1d4c0fe2","resolution":{"observed_at":"2026-07-12T04:21:23.867336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16498","last_updated":"2025-03-04T09:13:23Z","snapshot_observed_at":"2026-08-02T17:19:49.137620Z","submitted_at":"2024-08-29T12:56:06Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","version":2},"cited_work":{"arxiv_id":"2408.16498","doi":"10.48550/arxiv.2408.16498","metadata_source":"pith","pith_arxiv_id":"2408.16498","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","venue":"cs.SE","work_id":"dabfce49-50dd-4c91-a178-503523faeaeb","year":2024},"citing_paper":{"arxiv_id":"2607.08009","last_updated":"2026-07-09T00:27:07Z","snapshot_observed_at":"2026-08-03T01:18:12.663488Z","submitted_at":"2026-07-09T00:27:07Z","title":"From Execution to Education: A Bloom-Aligned Framework for Measuring Educational Control in LLMs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-10T13:49:17.343893Z"},"links":{"cited_paper":"/paper/2408.16498","citing_paper":"/paper/2607.08009"},"observation_digest":"sha256:81cbb3b2d1a9d317c798eadc25ba5a135cade0c426ed7170cedee7cde68860f4","observation_id":"76f4e29d-dd2f-4adb-862a-58c0aaad8dff","resolution":{"observed_at":"2026-07-10T13:57:06.865446Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16498","last_updated":"2025-03-04T09:13:23Z","snapshot_observed_at":"2026-08-02T17:19:49.137620Z","submitted_at":"2024-08-29T12:56:06Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16498","snapshot_observed_at":"2026-08-02T01:01:33.319622Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14816","last_updated":"2026-07-16T10:35:25Z","snapshot_observed_at":"2026-08-07T08:00:32.890992Z","submitted_at":"2026-07-16T10:35:25Z","title":"Large Language Models for Code Generation from Multilingual Prompts: A Curated Benchmark and a Study on Code Quality","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T01:01:33.319622Z"},"links":{"cited_paper":"/paper/2408.16498","citing_paper":"/paper/2607.14816"},"observation_digest":"sha256:200e7d34ba815f580f7289223c056df8716bfa5e3f538060d94170d69ab38333","observation_id":"9e1daf9c-3cdc-4972-9fc0-d32fc56393d8","resolution":{"observed_at":"2026-08-02T01:01:33.319622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2408.16498/citation-record","integrity":"/paper/2408.16498/integrity","json":"/paper/2408.16498/citation-record.json","paper":"/paper/2408.16498"},"outbound":[],"paper":{"arxiv_id":"2408.16498","last_updated":"2025-03-04T09:13:23Z","latest_version":2,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-02T17:19:49.137620Z","submitted_at":"2024-08-29T12:56:06Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 25 inbound Pith citation observations for arXiv:2408.16498."}