{"as_of":"2026-08-07T10:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:29bb72f6624e7484b488697a5acbe51048599d3a2a9d6f2d32c8aa85a604d947","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T20:39:00.617619Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.16569/citation-record","integrity":"/paper/2607.16569/integrity","json":"/paper/2607.16569/citation-record.json","paper":"/paper/2607.16569"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:55.479834Z","title":"Repairing deep neural networks: Fix patterns and challenges,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:55.479834Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:079ab478b065ff85d9dc847952858e912781875ddab5f0ae17d16cbd1a868527","observation_id":"a3801244-e99a-4587-88af-43b8c64dc68b","resolution":{"observed_at":"2026-08-01T20:38:55.479834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08632","last_updated":"2023-06-14T16:50:01Z","snapshot_observed_at":"2026-08-03T10:11:01.753054Z","submitted_at":"2023-06-14T16:50:01Z","title":"Characterizing Bugs in Python and R Data Analytics Programs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08632","snapshot_observed_at":"2026-08-01T20:38:55.530742Z","title":"Charac- terizing bugs in python and r data analytics programs,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:55.530742Z"},"links":{"cited_paper":"/paper/2306.08632","citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:9498577ea0ca2cdd9477f6e5fac5ba8e0518000779e0eb2f51d829f812248621","observation_id":"ec1ffc61-07e8-46fb-87f2-45bc11fb1864","resolution":{"observed_at":"2026-08-01T20:38:55.530742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:55.599291Z","title":"Towards understanding performance bugs in popular data science libraries,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:55.599291Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:2e982784794ecca10605636038c1f61bf418a5b93dc84c5873b5c04bd869abe1","observation_id":"f3b2b4ea-c7be-487c-84e3-101c61eed01b","resolution":{"observed_at":"2026-08-01T20:38:55.599291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:55.729697Z","title":"Towards understanding fine-grained programming mistakes and fixing patterns in data science,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:55.729697Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:e1613d7fd4be764cbad869ec4e03c2bc7686b04832184d1991c48b777ed774b5","observation_id":"85507504-ba06-476c-bc62-3b5df31bb8f3","resolution":{"observed_at":"2026-08-01T20:38:55.729697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:55.845230Z","title":"Bug analysis in jupyter notebook projects: An empirical study,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:55.845230Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:81a7680ffdf7187d8116c5e130517ff8e0b831ad7e6f741723d6d1ac0ac8d427","observation_id":"e5e22fb2-0db4-4350-8f8f-807fbdec270d","resolution":{"observed_at":"2026-08-01T20:38:55.845230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:55.930133Z","title":"Why do machine learning notebooks crash? an empirical study on public python jupyter notebooks,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:55.930133Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:e7d2950862f5bf3b0a20e5c4ef479f58ab7dfef131991af5ca5ebe949567c08c","observation_id":"22c7e398-bb87-4f7f-a343-0fbdc0bb2b49","resolution":{"observed_at":"2026-08-01T20:38:55.930133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:55.994151Z","title":"Studying vulnerable code entities in r,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:55.994151Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:ae15de0ee46f63ecb0e1e4056caa59332bde9e7ee5d9b2cb4f3c792344a16f3d","observation_id":"a77c61ba-988f-4cd7-9e1b-19dcfb18ef45","resolution":{"observed_at":"2026-08-01T20:38:55.994151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09771","last_updated":"2025-02-13T21:00:21Z","snapshot_observed_at":"2026-08-07T02:29:49.551173Z","submitted_at":"2025-02-13T21:00:21Z","title":"Knowledge-Enhanced Program Repair for Data Science Code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09771","snapshot_observed_at":"2026-08-01T20:38:56.102195Z","title":"Knowledge- enhanced program repair for data science code,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:56.102195Z"},"links":{"cited_paper":"/paper/2502.09771","citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:bab7379fa4762a7efbfb650a786c0704d1d8bc3d4865d25c20bd84b9c61bc6ef","observation_id":"f84bcaf0-84cf-4bd8-8e79-b206801ba279","resolution":{"observed_at":"2026-08-01T20:38:56.102195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:56.206570Z","title":"Specrover: Code intent extraction via llms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:56.206570Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:e7cb2f142eb8d8818462f875093c0643aa1837da2b8c185ad7eb66f09aa645e5","observation_id":"c864d44e-5bda-4b52-a3ae-4d9506ffc2ab","resolution":{"observed_at":"2026-08-01T20:38:56.206570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:56.274449Z","title":"How effective are llms for data science coding? a controlled experiment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:56.274449Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:fa66d04b430904b4be1bdedc13f5c60248087688b1ecac262c78434597e25e31","observation_id":"dcd74a92-7787-4737-8c4b-51ab070af6ec","resolution":{"observed_at":"2026-08-01T20:38:56.274449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:56.386871Z","title":"Improving patch correctness analysis via random testing and large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:56.386871Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:290f3221d35aa6e2d314eef4e44318de0f0a95a18d42bb18c61357870a2546de","observation_id":"540bc014-deb2-4a69-9f64-d42364df4bd7","resolution":{"observed_at":"2026-08-01T20:38:56.386871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:56.503514Z","title":"Do current language models support code intelligence for r programming language?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:56.503514Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:fa2763f3b4c92f1ea5c2ad5b7aa136a0df7de825b9695de21134142f3019e4fe","observation_id":"b41d7cf1-7797-49ad-9f8d-7ed9b865d258","resolution":{"observed_at":"2026-08-01T20:38:56.503514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:56.646789Z","title":"Can llms replace human evaluators? an empirical study of llm-as-a-judge in software engineering,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:56.646789Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:fb27602ae780c33a281b6211cb8936a2673e989395c9823675984dfad5cb5f0d","observation_id":"7b791086-016f-4091-a4f6-9a3b039b6295","resolution":{"observed_at":"2026-08-01T20:38:56.646789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:56.926962Z","title":"Patch correctness assessment: A survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:56.926962Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:7e7ff2134b71b5859b9e7be9b464c394bbe2338c04cd403c5f0e069c30c41807","observation_id":"e3ad60d8-1b80-4c0b-b6c2-bb091f8605f4","resolution":{"observed_at":"2026-08-01T20:38:56.926962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00202","last_updated":"2024-03-22T09:09:15Z","snapshot_observed_at":"2026-07-06T14:57:09.595092Z","submitted_at":"2023-03-01T03:12:11Z","title":"PatchZero: Zero-Shot Automatic Patch Correctness Assessment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00202","snapshot_observed_at":"2026-08-01T20:38:57.042547Z","title":"Patchzero: Zero-shot automatic patch correctness assessment,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:57.042547Z"},"links":{"cited_paper":"/paper/2303.00202","citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:19fcf30ad948fea902962a02536f3886de3db7af228009edda60549721604cf2","observation_id":"c7228b25-89a0-4d1d-815e-03d40fbc4cc7","resolution":{"observed_at":"2026-08-01T20:38:57.042547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:57.145809Z","title":"Tag Trends Data Science Libraries,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:57.145809Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:8403b09148d1aa2895d17d1ae33f6e59d81321db629e17c809f0b85fc318c3a4","observation_id":"23681fc4-7de1-4198-91a7-8ebdb21ed7ce","resolution":{"observed_at":"2026-08-01T20:38:57.145809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:57.240755Z","title":"What is the most efficient way of counting occurrences in pandas?","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:57.240755Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:f7f99e819e2205feadf98a9b7fc58a4a0a0e5ea42816f9aaf8e4c63a114e3e50","observation_id":"cacac818-fa97-44fc-9508-9d42a93aa6e6","resolution":{"observed_at":"2026-08-01T20:38:57.240755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:57.299795Z","title":"Output logs from AutoCodeRover and ArchCode ,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:57.299795Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:c0b13fbaced7c10d0f7b29112767c65b2f522a9456f76a9dc8db4eca5cf11a99","observation_id":"e8fdff6e-da35-4377-8292-91cc118e6840","resolution":{"observed_at":"2026-08-01T20:38:57.299795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:57.457301Z","title":"Autocoderover: Autonomous program improvement,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:57.457301Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:65e23a8dcee57edc122f076d6c89364a46b9d72429f9c1270927a53f367b9d31","observation_id":"931762d7-2687-468b-bb98-941bc666e30d","resolution":{"observed_at":"2026-08-01T20:38:57.457301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:57.586717Z","title":"Archcode: Incor- porating software requirements in code generation with large language 11 models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:57.586717Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:add96f941bcb4e98a6fdc6d634f8fe5dafda5023328b93785a84f9e055c69b0c","observation_id":"4d25fb0f-23be-4020-9005-d36d15991ad2","resolution":{"observed_at":"2026-08-01T20:38:57.586717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:57.699679Z","title":"ReprodGen Prompts,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:57.699679Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:0ceb12b20fb85210f583e96f74e223279282c36c54699178d8671402d4f1cb86","observation_id":"84d1835a-ea1a-405d-bf88-71146761950a","resolution":{"observed_at":"2026-08-01T20:38:57.699679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:57.737583Z","title":"Intermediate artifacts,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:57.737583Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:d872bac33c92048dd6d0e9862cdc59f7d25f4515daee91b6b1ad65e7e1215660","observation_id":"4a772003-bf8b-437a-9077-a9722debf1b1","resolution":{"observed_at":"2026-08-01T20:38:57.737583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:57.769711Z","title":"Structured chain-of-thought prompting for code generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:57.769711Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:9c27faaada5a68b5a9902f6950f8eec1be76960b12a6ad20cbcbe1e870596b6d","observation_id":"5bbae38e-59ac-4931-be6b-9d3a3c46bbbc","resolution":{"observed_at":"2026-08-01T20:38:57.769711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:57.820241Z","title":"Chain-of-thought prompting elicits reasoning in large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:57.820241Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:109ee31c383a82bb3ce185efbfe3ec9e7c6df71f0b51da840ec346075bc50f92","observation_id":"aef7d41c-17c0-43b0-a281-07995ad1c888","resolution":{"observed_at":"2026-08-01T20:38:57.820241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:57.896700Z","title":"On reliability of patch correctness assessment,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:57.896700Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:d8f086648ae1b85b44eb5f3ddda3c5653d9fbd653f28a6811b2878faae6c602c","observation_id":"423265e1-4278-4724-bfeb-d5aa0f728ff5","resolution":{"observed_at":"2026-08-01T20:38:57.896700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:57.962864Z","title":"Llm hallucinations in practical code generation: Phenomena, mechanism, and mitigation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:57.962864Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:4343ae975bd650b5ec6d0407cea62667b0742701bb875ba89e305c42e0e24181","observation_id":"f475e1d1-504f-49b0-b9ac-9be74d0e4de5","resolution":{"observed_at":"2026-08-01T20:38:57.962864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:58.056051Z","title":"Ds patch gen query,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:58.056051Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:36405020b3f644b0fae3196660983426ab8d9c65d5ff63440c38ff5639fa5e27","observation_id":"0dbd60a6-41ed-4f41-b4d9-d5695fb8b8c7","resolution":{"observed_at":"2026-08-01T20:38:58.056051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:58.098944Z","title":"Towards ai-assisted synthesis of verified dafny methods,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:58.098944Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:987c92ec76a08ded990f689963333192e94cad14862ed324350fea757537ca3c","observation_id":"03828dce-ea0b-42a3-b64e-a73827a81edd","resolution":{"observed_at":"2026-08-01T20:38:58.098944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:58.215028Z","title":"A comprehensive study on deep learning bug characteristics,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:58.215028Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:5be351a66247d3c75e4cb22357b19ce0d837fc940bd1cfb489ca02b6cf551894","observation_id":"4bcd05fb-b035-49e2-888d-e92fe698e1cf","resolution":{"observed_at":"2026-08-01T20:38:58.215028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:58.357953Z","title":"The art and practice of data science pipelines: A comprehensive study of data science pipelines in theory, in-the-small, and in-the-large,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:58.357953Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:a361d0fb51ab9a0ec51db445d4e21f5472754aeac98f36ac83a60684efd9e6ad","observation_id":"3daf92f8-9db2-4120-b6b0-0f5c8e19820e","resolution":{"observed_at":"2026-08-01T20:38:58.357953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:58.477473Z","title":"Bigcode models leaderboard,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:58.477473Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:639dce335706b598e4c6ec9cc8df9f0252d3a0a90cd4da92a565e218dd7ebc42","observation_id":"49ecd25a-899f-41d5-ad08-4ccdb02c7e03","resolution":{"observed_at":"2026-08-01T20:38:58.477473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-01T20:38:58.551665Z","title":"Qwen3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:58.551665Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:a596b28b0bd041b22fc27b44dbff968e14fc372fe61963e515a0eafff7905de5","observation_id":"4ea1952e-bfdc-48a9-b4d6-4c8bf869d6aa","resolution":{"observed_at":"2026-08-01T20:38:58.551665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-01T20:38:58.774747Z","title":"Gemma 3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:58.774747Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:f307335e61eff4d02073d68a7ea638f92dc3b8e11c67757f62ac9ef50e304636","observation_id":"936b7e89-cf60-463e-9139-c376623c820a","resolution":{"observed_at":"2026-08-01T20:38:58.774747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:58.902627Z","title":"Llama 3: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:58.902627Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:49c21dc552aac885a80054f5e354d674ec9796ec5d034b5f394c925c6fdfcf87","observation_id":"c435b79e-45cb-496a-82d3-fed828675a4c","resolution":{"observed_at":"2026-08-01T20:38:58.902627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11931","last_updated":"2024-06-17T13:51:35Z","snapshot_observed_at":"2026-08-07T06:30:25.302107Z","submitted_at":"2024-06-17T13:51:35Z","title":"DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11931","snapshot_observed_at":"2026-08-01T20:38:58.963799Z","title":"Deepseek-coder-v2: Breaking the barrier of closed-source models in code intelligence,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:58.963799Z"},"links":{"cited_paper":"/paper/2406.11931","citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:e53a5633ce285ea17b49ea8d6b12b4e1fdf32e8add94e52cb964cfa74281d45d","observation_id":"33003dfc-5152-489f-9bcb-0c8d63e7c98d","resolution":{"observed_at":"2026-08-01T20:38:58.963799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08905","last_updated":"2024-12-12T03:37:41Z","snapshot_observed_at":"2026-08-05T04:04:21.846023Z","submitted_at":"2024-12-12T03:37:41Z","title":"Phi-4 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08905","snapshot_observed_at":"2026-08-01T20:38:59.254556Z","title":"Phi- 4 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:59.254556Z"},"links":{"cited_paper":"/paper/2412.08905","citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:507f10f843c17450ac424f34e1251a70b3c8ed5bddb5c5f8e1e7c8601b5d6f21","observation_id":"422a8c36-adc6-4b0b-9e1a-32cc912daf89","resolution":{"observed_at":"2026-08-01T20:38:59.254556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:59.406456Z","title":"Evaluating and improving chatgpt for unit test generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:59.406456Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:16abdfc886644723b75250eed001f3642026021dd079135d9701d52ac69eac44","observation_id":"0ba18a7b-e203-481a-8929-714ca70f00b8","resolution":{"observed_at":"2026-08-01T20:38:59.406456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:59.474684Z","title":"Jailbreakbench: An open robustness benchmark for jailbreaking large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:59.474684Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:cdfdb58d5dacd02014c306b3ec152256ba9504fe0fdd5835760b76a238d5a567","observation_id":"9f42ef89-7bf6-4e0d-a923-8761c82f2cc6","resolution":{"observed_at":"2026-08-01T20:38:59.474684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:59.547262Z","title":"CodeBERTScore: Evaluating code generation with pretrained models of code,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:59.547262Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:9cf727e49a291d8a9105d0c8355530ed7229d47cf7b79b53aa47963862327d51","observation_id":"c58ed821-6f0d-424a-a467-a05849cb90f2","resolution":{"observed_at":"2026-08-01T20:38:59.547262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:59.607346Z","title":"Accurate and efficient refactoring detection in commit history,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:59.607346Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:b9c6c72d3b8468f61ebc7545dec3298253c10adbe7fd6c140744ebc963359c1d","observation_id":"dea723ac-3a95-4475-b761-f303707598b9","resolution":{"observed_at":"2026-08-01T20:38:59.607346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:59.664620Z","title":"Binary codes capable of correcting deletions, inser- tions, and reversals,","venue":null,"work_id":null,"year":1966},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:59.664620Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:782885fdc844abeb7f970b1a4198619b523c2d18b50618b94a3ab2bc4a2e0fa6","observation_id":"2f73f4d1-e944-43d8-bf4e-9b9d5cb26549","resolution":{"observed_at":"2026-08-01T20:38:59.664620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:59.738903Z","title":"Towards Understanding the Characteristics of Code Generation Errors Made by Large Language Models ,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:59.738903Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:c69ffb9e9449cb02d2dcd16508dd53692d714068c376f58b978d5add35f0d8c6","observation_id":"20d17fc7-5497-4e43-8722-e787940ddfcb","resolution":{"observed_at":"2026-08-01T20:38:59.738903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:59.810606Z","title":"Can LLMs reason about program semantics? a comprehensive evaluation of LLMs on formal specification inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:59.810606Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:3fd2d1be60f9e53cf6585aca0107707442b0c25e627679482fa2a7c8ba08e36b","observation_id":"d268fd13-a913-4d00-a871-0b0779774ca5","resolution":{"observed_at":"2026-08-01T20:38:59.810606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:59.876993Z","title":"Hints help finding and fixing bugs differently in python and text-based program representations,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:59.876993Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:7cf774969aec19113e2925d1ca4c7795dd910bd3501050ff4db422a0557797b3","observation_id":"e8fffa96-c86a-4c52-841d-d476a21e2ed5","resolution":{"observed_at":"2026-08-01T20:38:59.876993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:59.945666Z","title":"Imitation game: Reproduc- ing deep learning bugs leveraging an intelligent agent,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:59.945666Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:dd2ac9d744cf10fc6a2412ac1a6fe70476541d686fa132d1b9883367e5810b8a","observation_id":"71af787a-57c8-4fda-9780-c0192cf59d78","resolution":{"observed_at":"2026-08-01T20:38:59.945666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:39:00.062426Z","title":"Zs4c: Zero-shot synthesis of compilable code for incomplete code snippets using llms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T20:39:00.062426Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:9a9286a7ef9bfd401077a23f41c41be23255e61a095e1a2f854fb5e3fb677c5d","observation_id":"ed282c0c-46a4-49e6-829e-3fc3a55b90b2","resolution":{"observed_at":"2026-08-01T20:39:00.062426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:39:00.147778Z","title":"Selfpico: Self-guided partial code execution with llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T20:39:00.147778Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:33478d7298dab598df7b29c8b817afc7186079bef191ad9ae815c02ba00bba3c","observation_id":"da7d772a-3ad7-495e-b088-5ec36d6cf7a5","resolution":{"observed_at":"2026-08-01T20:39:00.147778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:39:00.224401Z","title":"Evaluating large language models in class-level code generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T20:39:00.224401Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:a103ce3a1669c173ead19940a79b542eb928afb77f1c8645ef6c7c926344c59e","observation_id":"2d7357ea-b16e-49ce-a389-3dd0faabd2ab","resolution":{"observed_at":"2026-08-01T20:39:00.224401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:39:00.264514Z","title":"Identifying patch correctness in test-based program repair,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T20:39:00.264514Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:0bcc95f32e12a17a151e3cbf22db0c9a719d3204c7c31708c2e6be8a35bb14c4","observation_id":"58af5cb1-ab5c-4ef7-9ee5-1d0c49ad4d4d","resolution":{"observed_at":"2026-08-01T20:39:00.264514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:39:00.323748Z","title":"ReprodGen Repository,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T20:39:00.323748Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:155ded75ab69befc9b7aaae10f442eb32fde8ec05b6f5ef52ea3afb5bb9580d4","observation_id":"e4cd068e-285a-4be0-86fe-50010ab3d885","resolution":{"observed_at":"2026-08-01T20:39:00.323748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:39:00.453850Z","title":"ReprodGen Bench,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T20:39:00.453850Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:94f2144dadd3446dd6114622a23f559f8b48f45ddeb488a952c1438105f51b5e","observation_id":"9d903af3-b7b7-4f6b-919e-ab691bfc547f","resolution":{"observed_at":"2026-08-01T20:39:00.453850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:39:00.617619Z","title":"ReprodGen Leaderboard,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T20:39:00.617619Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:6b0eb6ea4918911e247fcf23bda75012046389f37adbe9c7ab98c3748ba99845","observation_id":"f1533079-2d44-45bf-bf9b-3f7471ff3ac0","resolution":{"observed_at":"2026-08-01T20:39:00.617619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:56.800567Z","title":"Available: https://doi.org/10.1145/3728963","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:56.800567Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:50e21fb5c4a4d7c7b4f9d4f246b1ef2c341f919791cd2d264ec87fdee2bdcc0a","observation_id":"207b0dfe-636b-4a3e-bf36-a0dfea06520f","resolution":{"observed_at":"2026-08-01T20:38:56.800567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-07T09:08:43.582347Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2607.16569."}