{"as_of":"2026-08-08T12:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f726080bf295ea2dfdbe33a94918f2afa265cac55bb7db9d902d95c4c003245c","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:38:53.742442Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T14:46:30.803463Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"cited_work":{"arxiv_id":"2507.20439","doi":"10.48550/arxiv.2507.20439","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.20439","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"When prompts go wrong: Evaluating code model robustness to ambiguous, contradictory, and incomplete task descriptions,","venue":"arXiv (Cornell University)","work_id":"d14b55dc-b2cd-4daa-9a15-fd2e25f33927","year":2025},"citing_paper":{"arxiv_id":"2604.24703","last_updated":"2026-04-27T17:07:08Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:07:08Z","title":"Defective Task Descriptions in LLM-Based Code Generation: Detection and Analysis","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T03:07:06.924437Z"},"links":{"cited_paper":"/paper/2507.20439","citing_paper":"/paper/2604.24703"},"observation_digest":"sha256:66d2310b6313c8cec681509df8970efe2a4f13c4da49d1ac5626443fa974fa97","observation_id":"198ab81f-943e-426d-98b9-64b4c293c359","resolution":{"observed_at":"2026-05-11T22:16:34.336735Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"cited_work":{"arxiv_id":"2507.20439","doi":"10.48550/arxiv.2507.20439","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.20439","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"When prompts go wrong: Evaluating code model robustness to ambiguous, contradictory, and incomplete task descriptions,","venue":"arXiv (Cornell University)","work_id":"d14b55dc-b2cd-4daa-9a15-fd2e25f33927","year":2025},"citing_paper":{"arxiv_id":"2604.24712","last_updated":"2026-04-27T17:21:09Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:21:09Z","title":"When Prompt Under-Specification Improves Code Correctness: An Exploratory Study of Prompt Wording and Structure Effects on LLM-Based Code Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T03:00:26.137401Z"},"links":{"cited_paper":"/paper/2507.20439","citing_paper":"/paper/2604.24712"},"observation_digest":"sha256:a4ba72d3f91635ead2b9f40d49d9c878a674eecc5e370b149e182e5b3215c537","observation_id":"70807c01-e5e1-4017-aeca-80197e2fbaef","resolution":{"observed_at":"2026-05-11T22:17:08.166144Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"cited_work":{"arxiv_id":"2507.20439","doi":"10.48550/arxiv.2507.20439","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.20439","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"When prompts go wrong: Evaluating code model robustness to ambiguous, contradictory, and incomplete task descriptions,","venue":"arXiv (Cornell University)","work_id":"d14b55dc-b2cd-4daa-9a15-fd2e25f33927","year":2025},"citing_paper":{"arxiv_id":"2607.00711","last_updated":"2026-07-01T09:58:59Z","snapshot_observed_at":"2026-08-06T07:37:13.161699Z","submitted_at":"2026-07-01T09:58:59Z","title":"ClarifyCodeBench: Evaluating LLMs on Clarifying Ambiguous Requirements for Code Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-02T08:39:01.987915Z"},"links":{"cited_paper":"/paper/2507.20439","citing_paper":"/paper/2607.00711"},"observation_digest":"sha256:41a7251d20bd5537207116f49981fb97b04975ad81dbdf33aa0825dbd59d28e8","observation_id":"77d8fa42-aa49-4696-b4b2-df3eb3d40d82","resolution":{"observed_at":"2026-07-02T08:46:48.648730Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"cited_work":{"arxiv_id":"2507.20439","doi":"10.48550/arxiv.2507.20439","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.20439","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"When prompts go wrong: Evaluating code model robustness to ambiguous, contradictory, and incomplete task descriptions,","venue":"arXiv (Cornell University)","work_id":"d14b55dc-b2cd-4daa-9a15-fd2e25f33927","year":2025},"citing_paper":{"arxiv_id":"2607.01953","last_updated":"2026-07-02T09:43:15Z","snapshot_observed_at":"2026-08-05T12:45:21.081391Z","submitted_at":"2026-07-02T09:43:15Z","title":"Underspecification does not imply Incoherence: The Risks of Semantic Collapse in Coding Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-03T09:01:48.501745Z"},"links":{"cited_paper":"/paper/2507.20439","citing_paper":"/paper/2607.01953"},"observation_digest":"sha256:4b15932a243b1dd954b52a5397028eeddccbf54660a4aefdf856b29174141e69","observation_id":"fe9cb4ff-ad6e-4b67-b6d8-139a902c8018","resolution":{"observed_at":"2026-07-03T09:07:47.017340Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"cited_work":{"arxiv_id":"2507.20439","doi":"10.48550/arxiv.2507.20439","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.20439","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"When prompts go wrong: Evaluating code model robustness to ambiguous, contradictory, and incomplete task descriptions,","venue":"arXiv (Cornell University)","work_id":"d14b55dc-b2cd-4daa-9a15-fd2e25f33927","year":2025},"citing_paper":{"arxiv_id":"2607.02333","last_updated":"2026-07-02T15:37:54Z","snapshot_observed_at":"2026-08-01T02:53:20.052715Z","submitted_at":"2026-07-02T15:37:54Z","title":"Guiding Human Validation of LLM-Generated Code via Verifiable Literate Programming","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-03T08:42:04.804042Z"},"links":{"cited_paper":"/paper/2507.20439","citing_paper":"/paper/2607.02333"},"observation_digest":"sha256:00c19f7e1180aade2ac98808d577685ff84ab75afa588d804c04445279acb115","observation_id":"b9f16e6d-8e35-411a-8ed3-6728eba63bfd","resolution":{"observed_at":"2026-07-03T08:47:49.713356Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20439","snapshot_observed_at":"2026-07-11T17:45:46.872944Z","title":"arXiv preprint arXiv:2507.20439 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04537","last_updated":"2026-07-05T22:55:03Z","snapshot_observed_at":"2026-08-06T17:59:40.679958Z","submitted_at":"2026-07-05T22:55:03Z","title":"Obey, Diverge, Collapse: Blind Obedience to Incorrect Instructions Drives Code LLMs to Irrecoverable Code Semantic Collapse","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-11T17:45:46.872944Z"},"links":{"cited_paper":"/paper/2507.20439","citing_paper":"/paper/2607.04537"},"observation_digest":"sha256:56178b34ad2bfedd3d6047a702cefc3ef3bf5496bb998ebf29251ab76d3da907","observation_id":"bb9764c9-2676-429e-8063-7ebddb3de03f","resolution":{"observed_at":"2026-07-11T17:45:46.872944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20439","snapshot_observed_at":"2026-07-11T08:31:24.850506Z","title":"When prompts go wrong: Evaluating code model robustness to ambiguous, contradictory, and incomplete task descriptions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05121","last_updated":"2026-07-06T14:10:56Z","snapshot_observed_at":"2026-08-07T08:27:08.132590Z","submitted_at":"2026-07-06T14:10:56Z","title":"From Failing to Passing: Evolving Natural Language Prompt Optimization Rules for LLM Code Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T08:31:24.850506Z"},"links":{"cited_paper":"/paper/2507.20439","citing_paper":"/paper/2607.05121"},"observation_digest":"sha256:d9f3854e8e953b96e671d3a890ae24d5badcdbb9c90645b03db151a8fee3359e","observation_id":"158d4e41-4d94-43b7-a6fc-b6a5bb766ec5","resolution":{"observed_at":"2026-07-11T08:31:24.850506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20439","snapshot_observed_at":"2026-07-11T08:12:23.512737Z","title":"When prompts go wrong: Evaluating code model robustness to ambiguous, contradictory, and incomplete task descriptions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05139","last_updated":"2026-07-06T14:23:30Z","snapshot_observed_at":"2026-08-04T20:23:02.335560Z","submitted_at":"2026-07-06T14:23:30Z","title":"On the risk of coding before testing: An empirical study on LLM-based test generation workflow","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-11T08:12:23.512737Z"},"links":{"cited_paper":"/paper/2507.20439","citing_paper":"/paper/2607.05139"},"observation_digest":"sha256:9af85d6da2938b04d8c2f12355b27b9730d47889330057fe5d80a80ba735c38f","observation_id":"1bd8e22d-9906-4da1-90b9-62a267294cc7","resolution":{"observed_at":"2026-07-11T08:12:23.512737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20439","snapshot_observed_at":"2026-08-02T14:46:30.803463Z","title":"When prompts go wrong: Evaluating code model robustness to ambiguous, contradictory, and incomplete task descriptions.CoRR, abs/2507.20439, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14105","last_updated":"2026-05-07T15:50:42Z","snapshot_observed_at":"2026-08-07T05:59:04.707862Z","submitted_at":"2026-05-07T15:50:42Z","title":"Automatically Evolving Prompt Guidelines for Task-Specific Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T14:46:30.803463Z"},"links":{"cited_paper":"/paper/2507.20439","citing_paper":"/paper/2607.14105"},"observation_digest":"sha256:a46d09d293487e87180354cccc9c51528d7c087f4a53b1a335dce399919b27ea","observation_id":"4d2e8f86-3a11-4e4b-bc0e-b731365ec346","resolution":{"observed_at":"2026-08-02T14:46:30.803463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20439","snapshot_observed_at":"2026-08-01T04:15:29.179347Z","title":"When prompts go wrong: Eval- uating code model robustness to ambiguous, contradictory, and incomplete task descriptions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22898","last_updated":"2026-07-24T20:22:59Z","snapshot_observed_at":"2026-08-06T08:51:02.319139Z","submitted_at":"2026-07-24T20:22:59Z","title":"AssumptionMiner: Extracting, Tracing, and Revising Implicit Assumptions in LLM Code Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T04:15:29.179347Z"},"links":{"cited_paper":"/paper/2507.20439","citing_paper":"/paper/2607.22898"},"observation_digest":"sha256:cbe01ca6c6edbf05d35214824b05293b5475154b2118fbed765dbfdda8e071b6","observation_id":"c853259f-c273-4ff6-b6a2-3bac8e2e1e11","resolution":{"observed_at":"2026-08-01T04:15:29.179347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20439","snapshot_observed_at":"2026-07-30T23:35:19.791382Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24854","last_updated":"2026-07-25T22:57:05Z","snapshot_observed_at":"2026-08-08T04:14:03.739147Z","submitted_at":"2026-07-25T22:57:05Z","title":"VClare: Resolving Imperfect Specifications in LLM-Based Verilog Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-30T23:35:19.791382Z"},"links":{"cited_paper":"/paper/2507.20439","citing_paper":"/paper/2607.24854"},"observation_digest":"sha256:428d919fd76b5fb72f6e0b957e271a5247e5960f1f9ba9f6545ca7199d9c22c0","observation_id":"2b7984f4-f449-4cc1-9e8d-bd32b8930620","resolution":{"observed_at":"2026-07-30T23:35:19.791382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.20439/citation-record","integrity":"/paper/2507.20439/integrity","json":"/paper/2507.20439/citation-record.json","paper":"/paper/2507.20439"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1998.88286","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:38:55.094130Z","title":"IEEE Recommended Practice for Software Requirements Specifications","venue":null,"work_id":"25bdab86-2e49-461a-97a2-7bfd9fa15afc","year":1998},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:47.649609Z"},"links":{"citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:a13c3675fefde5d2bc282b5abf6e29079126f75154a07647892c50ac026f1a30","observation_id":"9df98d93-dda8-4a14-b4d0-f058be2027d3","resolution":{"observed_at":"2026-08-06T13:38:55.205137Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14196","last_updated":"2024-01-26T09:23:11Z","snapshot_observed_at":"2026-08-06T22:40:28.707813Z","submitted_at":"2024-01-25T14:17:53Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14196","snapshot_observed_at":"2026-08-06T13:38:47.768131Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:47.768131Z"},"links":{"cited_paper":"/paper/2401.14196","citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:adb5a40b752f24c46727e26f9313bb59025be28daf1de8d5e33afbadc52bc7b8","observation_id":"a27cb455-ca01-4845-932d-4b37bcdd76f2","resolution":{"observed_at":"2026-08-06T13:38:47.768131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:00.024745Z","title":null,"venue":null,"work_id":"a7e3f5b1-7c03-4d69-b7ad-fab0299373c3","year":2025},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:47.886462Z"},"links":{"citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:7945461b87328a73560dcd8a11a8dfedac3bbf56ff0dc588f88d563af480a118","observation_id":"23de4ca7-f7e8-4054-8996-c4466765f738","resolution":{"observed_at":"2026-08-06T13:39:00.084889Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-06T13:38:48.144648Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:48.144648Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:69b4af376a2a16ee4a46548635bdc4d5d0eca9d75b461c21360c0b53a87d4ad7","observation_id":"c6a564b6-62bf-444e-bc17-df086f55d3ee","resolution":{"observed_at":"2026-08-06T13:38:48.144648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:38:59.800667Z","title":null,"venue":null,"work_id":"9f62e231-a644-4d79-b437-afcdd594b751","year":2014},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:48.298871Z"},"links":{"citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:0830e8023f646d46443e554d23a6ad887a8a7626358a04cd921b5da45aaaef18","observation_id":"0fac6cd1-51e4-41fa-9b8b-0bb56846416b","resolution":{"observed_at":"2026-08-06T13:38:59.929664Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:38:59.626206Z","title":null,"venue":null,"work_id":"5e64f1af-5b6d-4562-89a6-b85bf4f52ff1","year":2025},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:48.420423Z"},"links":{"citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:8242d8b09276ddb00b85ab429405ff0b4549983ad8b503353dc59b560a26c9ee","observation_id":"87fd0afb-5e94-4171-9253-850d8306a7ec","resolution":{"observed_at":"2026-08-06T13:38:59.673488Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-06T13:38:48.655287Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:48.655287Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:b8dc1ea582ef77b3543ed31a5a0bc8e6f10548ba3ddde6c5e73ccf0e7cfc63de","observation_id":"eff87302-791c-471f-ba3b-c2a38e176e51","resolution":{"observed_at":"2026-08-06T13:38:48.655287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:38:48.816979Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:48.816979Z"},"links":{"citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:1888bc5a390440a0b00d7dd96433e638c5f8a5c928976cd16f5723949e2d3404","observation_id":"b13455d5-6388-4554-8959-e2e884814991","resolution":{"observed_at":"2026-08-06T13:38:48.816979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:38:49.100177Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:49.100177Z"},"links":{"citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:6447b9db1a9f52f57663dca2b8b8ce0f96254dba025a17ea7f1990e6f0e1a73b","observation_id":"b6a20980-cb7d-4729-a40e-20159448581b","resolution":{"observed_at":"2026-08-06T13:38:49.100177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01183","last_updated":"2023-06-01T22:43:37Z","snapshot_observed_at":"2026-07-06T15:36:56.786182Z","submitted_at":"2023-06-01T22:43:37Z","title":"Systematic Evaluation of GPT-3 for Zero-Shot Personality Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01183","snapshot_observed_at":"2026-08-06T13:38:49.217874Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:49.217874Z"},"links":{"cited_paper":"/paper/2306.01183","citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:c45dbb2cff07fe783e1f38acb8f0d76cd657547c7008a5678ccf0c2a8b487dc1","observation_id":"365d18e0-4cd8-49f8-9f39-dde997ede50a","resolution":{"observed_at":"2026-08-06T13:38:49.217874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.09938","last_updated":"2021-11-08T21:16:44Z","snapshot_observed_at":"2026-08-04T23:13:25.514661Z","submitted_at":"2021-05-20T17:58:42Z","title":"Measuring Coding Challenge Competence With APPS","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.09938","snapshot_observed_at":"2026-08-06T13:38:49.326645Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:49.326645Z"},"links":{"cited_paper":"/paper/2105.09938","citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:a55e4a08e2d1992cf4e7129cc726ce47b04244dabc6e929a8f235ba6fad0d716","observation_id":"161d3724-ede3-4f83-94cc-e2353ac70e94","resolution":{"observed_at":"2026-08-06T13:38:49.326645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:38:49.436262Z","title":null,"venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:49.436262Z"},"links":{"citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:e2c06d38421693b01f63ec8c93e22af93a5e28dd7c24b0ad0a6457e0e3564e69","observation_id":"725e18f3-d124-42a1-99bc-91ff4d39a635","resolution":{"observed_at":"2026-08-06T13:38:49.436262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:38:49.547770Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:49.547770Z"},"links":{"citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:42ec82885170aa6cb42cf33234fe09c6ec9516768247e27dc1ee2cd7c36c0a3d","observation_id":"8c056224-3794-45f4-8d08-3fad5c1eee98","resolution":{"observed_at":"2026-08-06T13:38:49.547770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:38:59.393618Z","title":null,"venue":null,"work_id":"48fefcee-b5c2-4317-a875-28209e44793e","year":2024},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:49.766965Z"},"links":{"citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:f697ccdb53ea7fb0e1f109ab950b45606139b15399d8cc6b8b1f1ac45f356307","observation_id":"ca011c1e-cbf9-4062-8c5e-770820f1c436","resolution":{"observed_at":"2026-08-06T13:38:59.481548Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:38:59.214146Z","title":null,"venue":null,"work_id":"0dd61a1a-c026-4f70-98c3-9901adf1b3ab","year":2006},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:49.914221Z"},"links":{"citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:168f3557cc6eb4de9b97c0f6c312055161c0f20c259e42f620b4d5a3cffca87e","observation_id":"2fed75e1-c953-40cd-b241-b8c68755a4c1","resolution":{"observed_at":"2026-08-06T13:38:59.337232Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:38:59.056356Z","title":null,"venue":null,"work_id":"b83a96fe-cc75-47ff-b9dc-27e3d2148df7","year":2023},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:50.005883Z"},"links":{"citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:f8969329f443032400bc272756a4dddaf60f54bc23061aa132508270f6677858","observation_id":"f85e91c9-e344-4da7-833b-a4e2fd9a7e11","resolution":{"observed_at":"2026-08-06T13:38:59.122903Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:38:58.844948Z","title":null,"venue":null,"work_id":"d380ebf1-eaa2-4c12-904e-9b24849c65c0","year":null},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:50.063162Z"},"links":{"citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:ccec89113591f71e059965ae3d174e976e794ac23c683e749bfc3f05ca173d76","observation_id":"ee94a9d0-b71b-42cf-8498-dc7de55822a9","resolution":{"observed_at":"2026-08-06T13:38:58.949258Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:38:50.268739Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:50.268739Z"},"links":{"citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:44b53ae2427d76c644338c2c48d9e2846fd8de66a30341520620ab1f76751edb","observation_id":"5358355d-f85f-46c2-ab56-11a97fdb9406","resolution":{"observed_at":"2026-08-06T13:38:50.268739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1985.22977","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:38:54.591631Z","title":null,"venue":null,"work_id":"7d25fd7a-fccd-4e4e-aa10-0be2c46faef4","year":1985},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:50.390088Z"},"links":{"citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:1f7f1a285b9093818fa80ed195ea353ba9d16d31b0b3ced324158cdd82f32436","observation_id":"20e2a215-9354-4920-b9b5-6e3907489b99","resolution":{"observed_at":"2026-08-06T13:38:54.736511Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:38:50.555980Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:50.555980Z"},"links":{"citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:523a5f82db5faf0e3a14fa7c1d6048365bd05175cbc4bb251ed5f6f00e39a4fc","observation_id":"a18c74fa-41c2-4b64-9e60-c3939ed13364","resolution":{"observed_at":"2026-08-06T13:38:50.555980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:38:58.553952Z","title":null,"venue":null,"work_id":"20ab8eee-c97a-4d89-a572-81957466f4ff","year":2023},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:50.824677Z"},"links":{"citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:0db09abc4585d5ebc3b48cce26ed4b0b798a4a0db7fb54cb569e05e7092c48d0","observation_id":"aface219-411c-4fbe-9a10-cfbfea79d036","resolution":{"observed_at":"2026-08-06T13:38:58.616747Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s00766-021-00367-z","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:38:53.879208Z","title":null,"venue":null,"work_id":"84107519-3868-4ce4-a85f-eb2c02560813","year":2022},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:50.698361Z"},"links":{"citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:03f4725ca7bfb329f59ddbfc41ee3bb6dcfff14fa26960bfa589760fc86b74e8","observation_id":"982fa63d-cedf-4c65-9275-22cf2d04f7b1","resolution":{"observed_at":"2026-08-06T13:38:54.019782Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[{"edge_observation":{"observed_at":"2026-08-06T18:20:19.997473+00:00","source":"paper_reference_links","state":"open"},"event_date":"2022-04-04","event_type":"correction","notice_doi":"10.1007/s00766-022-00378-4","provenance":{"observed_at":"2026-07-11T02:57:50.434999+00:00","source":"crossref","source_record_id":"10.1007/s00766-022-00378-4->10.1007/s00766-021-00367-z:correction"}}],"reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T13:38:51.181674Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:51.181674Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:6a514e085fb3c8e1d6ea25c990211d83612b0452e3e5decb5820c2473030469d","observation_id":"fa8f5d74-5fa1-4823-8f1e-083426e837c7","resolution":{"observed_at":"2026-08-06T13:38:51.181674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:38:58.247573Z","title":null,"venue":null,"work_id":"67b1f4ff-1cb0-458d-bc3e-8a0926a2bac9","year":2025},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:51.043563Z"},"links":{"citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:0ea6e58fa7bda70def3aa595219ae41b94dad3b33f345b89bf6d13a62ae5460b","observation_id":"39c13da2-363a-4edd-8061-d9b3ceb02ba4","resolution":{"observed_at":"2026-08-06T13:38:58.387181Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:38:57.534884Z","title":null,"venue":null,"work_id":"6ee32cef-144a-491d-87c8-e566dd705517","year":2018},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:51.425304Z"},"links":{"citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:0496aaa7b260a38c5840963ae95e2a594a496f0f1372ea345596a2ed782b0e4e","observation_id":"45e8c2d1-c011-4765-8ee6-54bf5031f8ad","resolution":{"observed_at":"2026-08-06T13:38:57.675628Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:38:57.860279Z","title":null,"venue":null,"work_id":"c1ebd240-3fe2-4481-936f-d192cc119070","year":2023},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:51.285484Z"},"links":{"citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:d434ae9fa98f78a91b9c8d7ff993316866e04094b880412674f260990ce240f6","observation_id":"74c4d79d-8833-4016-9175-2a3328b65748","resolution":{"observed_at":"2026-08-06T13:38:58.007097Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:38:57.151691Z","title":null,"venue":null,"work_id":"28d0996d-6ea5-4674-aab9-6a3f0dccece5","year":null},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:51.687667Z"},"links":{"citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:bdb611cf579f9ab6c0440bbff143c71b7c46e86beb3e8c05701462db7767881c","observation_id":"e34977af-ddde-4c41-b37f-5331bc09f3cb","resolution":{"observed_at":"2026-08-06T13:38:57.302392Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:38:57.375800Z","title":null,"venue":null,"work_id":"c0af8c93-800c-4397-b3ac-c0f41afb5b73","year":2025},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:51.583331Z"},"links":{"citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:c35b8658f2300fd71c7541953ab8ae841d6f92886d2ce3fb92c4c8c6e91c888f","observation_id":"dc21c2dd-ad0a-4abe-bfc5-21ccb202e113","resolution":{"observed_at":"2026-08-06T13:38:57.436680Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:38:56.963553Z","title":null,"venue":null,"work_id":"e664736d-583b-4b67-bded-9b6efd87c485","year":2024},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:51.934242Z"},"links":{"citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:7bc27a55efeb4484b6758b621bc1e0a64f932bca308284665cb447e6cd1f3f4c","observation_id":"7f9f76a7-6b47-4e1d-8575-5cde5af1b13c","resolution":{"observed_at":"2026-08-06T13:38:57.053010Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-06T13:38:51.815907Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:51.815907Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:2b894119039a5727c84faa153bac80a1d1d3eae904621ee73804c3cd744ecea0","observation_id":"7362a76e-f3f8-4a6d-b97a-5d3d60c1cc65","resolution":{"observed_at":"2026-08-06T13:38:51.815907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:38:56.424980Z","title":null,"venue":null,"work_id":"f6086b2f-ee0b-4efd-b146-e25471c5600b","year":null},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:52.256132Z"},"links":{"citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:785d4f6f5a768b2b5b352e65ea7507c0b4afdf0a2ff74fb9a5eb9752dc8a119d","observation_id":"61318ea6-a0f4-41c4-8f1b-7d14faacdcbc","resolution":{"observed_at":"2026-08-06T13:38:56.559707Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:38:56.715515Z","title":null,"venue":null,"work_id":"f98638a0-6dc4-40b1-a9a0-cc1b815a2062","year":2025},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:52.141096Z"},"links":{"citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:a949c22e2ff6b8e1d7eb45ea951926f7e29174d33fc7915bbc42e8853b026ccb","observation_id":"2542d470-b572-492f-803d-c90b569f308b","resolution":{"observed_at":"2026-08-06T13:38:56.839141Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:38:56.197978Z","title":null,"venue":null,"work_id":"6e6f6f3d-0b41-4a2a-b828-bc56e2de5834","year":2022},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:52.526338Z"},"links":{"citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:ab58870ea95f3054453bd952376695fd45b0d744f71973131039ef982bf9d59f","observation_id":"353dce04-6766-4e73-870b-f95226b2934c","resolution":{"observed_at":"2026-08-06T13:38:56.312009Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03482","last_updated":"2023-03-06T20:25:16Z","snapshot_observed_at":"2026-08-08T11:49:52.732737Z","submitted_at":"2023-03-06T20:25:16Z","title":"Recent Advances in Software Effort Estimation using Machine Learning","version":1},"cited_work":{"arxiv_id":"2303.03482","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.03482","snapshot_observed_at":"2026-08-06T13:38:54.227494Z","title":"Recent Advances in Software Effort Estimation using Machine Learning","venue":"cs.SE","work_id":"c5f4c51e-a38c-4cd9-9539-69eeee104677","year":2023},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:52.374590Z"},"links":{"cited_paper":"/paper/2303.03482","citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:95c33954f4959980d0dc422b9eb6b8e73429ff02fbf398ce3d38c2b421c18537","observation_id":"e37dd0df-15a1-48b8-85a3-2fda37ee3973","resolution":{"observed_at":"2026-08-06T13:38:54.305710Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02395","last_updated":"2024-07-04T08:59:31Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:13:21Z","title":"Is Your AI-Generated Code Really Safe? Evaluating Large Language Models on Secure Code Generation with CodeSecEval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02395","snapshot_observed_at":"2026-08-06T13:38:52.828980Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:52.828980Z"},"links":{"cited_paper":"/paper/2407.02395","citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:5d8c4810db0d74d8f81bd2c02b50a424c728355b0104c8ad3bb6e3c72db056f4","observation_id":"0cfa7f88-6cea-4a69-8188-34069b47c5d3","resolution":{"observed_at":"2026-08-06T13:38:52.828980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:38:55.968976Z","title":null,"venue":null,"work_id":"dad21c76-3f94-4cd1-8d3b-e32d951da979","year":2009},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:52.695032Z"},"links":{"citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:d9838556503757f054d3abba6be26bf793b076d29cb5dd6255bb8625b53e7406","observation_id":"8d00f9a7-7715-4037-9396-90903b31b54f","resolution":{"observed_at":"2026-08-06T13:38:56.058687Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04730","last_updated":"2023-12-12T19:42:11Z","snapshot_observed_at":"2026-07-06T16:58:36.087327Z","submitted_at":"2023-12-07T22:19:06Z","title":"DeceptPrompt: Exploiting LLM-driven Code Generation via Adversarial Natural Language Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04730","snapshot_observed_at":"2026-08-06T13:38:53.175435Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:53.175435Z"},"links":{"cited_paper":"/paper/2312.04730","citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:824a299a852d779afa765847aa46235660164a163d527def31f6c59c97f5c6d0","observation_id":"cbc77a68-d9ca-4d9d-a33d-29c36136f676","resolution":{"observed_at":"2026-08-06T13:38:53.175435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10264","last_updated":"2022-12-20T14:11:31Z","snapshot_observed_at":"2026-07-31T00:03:51.024506Z","submitted_at":"2022-12-20T14:11:31Z","title":"ReCode: Robustness Evaluation of Code Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10264","snapshot_observed_at":"2026-08-06T13:38:53.002137Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:53.002137Z"},"links":{"cited_paper":"/paper/2212.10264","citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:981b7211c306042af45eee8c7ee32b145d0de9d0db1263fb64ff6094f7dcf277","observation_id":"8a3ba20e-0ce5-4251-8cc3-30bc68fb2477","resolution":{"observed_at":"2026-08-06T13:38:53.002137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11928","last_updated":"2025-06-13T16:29:09Z","snapshot_observed_at":"2026-08-07T05:17:24.433763Z","submitted_at":"2025-06-13T16:29:09Z","title":"LiveCodeBench Pro: How Do Olympiad Medalists Judge LLMs in Competitive Programming?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11928","snapshot_observed_at":"2026-08-06T13:38:53.452180Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:53.452180Z"},"links":{"cited_paper":"/paper/2506.11928","citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:22018c0ce0e281cef9e32c3384bd2d530e9a9d711569d6499b623f96e8640e57","observation_id":"71430e1e-2df9-4de9-8f9f-1a75c545da80","resolution":{"observed_at":"2026-08-06T13:38:53.452180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:38:55.757915Z","title":null,"venue":null,"work_id":"89be3305-c35b-4e05-9dd3-e5a187cd6817","year":2022},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:53.396905Z"},"links":{"citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:e2c30da0fc72f1f735f18f789beef810fa7da83de7e29a6bc5fae432a8c43a9e","observation_id":"f86c9d45-f912-4324-9e17-cf9f78ff88d5","resolution":{"observed_at":"2026-08-06T13:38:55.836809Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:38:55.343686Z","title":null,"venue":null,"work_id":"0448a360-0b60-4116-bc1d-7441d67ecf33","year":2024},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:53.742442Z"},"links":{"citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:f38262c1cd9a8ddf426fbfb02d7f44fd2e527bac52a9ab64e13c49c7e759a7c7","observation_id":"a1570c58-f6a5-43b8-b3bc-45a685e623fc","resolution":{"observed_at":"2026-08-06T13:38:55.486547Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:38:55.610265Z","title":null,"venue":null,"work_id":"6b29cff7-656c-4ce8-a893-8f034a4acb07","year":2025},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:53.611065Z"},"links":{"citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:4dbc49b4b4ab92fd10f059ee613c18706a7b2e0768ae729e6644b05368871648","observation_id":"365c216c-8b0a-48cd-a867-06d1e6cf07da","resolution":{"observed_at":"2026-08-06T13:38:55.691351Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:38:58.720132Z","title":"Software: Practice and experience 52, 1 (2022), 39–65","venue":null,"work_id":"949c34ce-dc12-40da-b7c3-73c7ec4f4317","year":2022},"citing_paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T13:38:50.181171Z"},"links":{"citing_paper":"/paper/2507.20439"},"observation_digest":"sha256:fb19a2e8fbeba02d8b5adf57d1ebe23a58c56a6d75acdde093f7ab0aa22657a3","observation_id":"f0cc826d-8542-49ee-b570-66ae34b1b1de","resolution":{"observed_at":"2026-08-06T13:38:58.753242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.20439","last_updated":"2025-07-27T23:16:14Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-07T08:26:38.024790Z","submitted_at":"2025-07-27T23:16:14Z","title":"When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":38,"verified_exact":3,"verified_fuzzy":1},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 11 inbound Pith citation observations for arXiv:2507.20439."}