{"as_of":"2026-08-05T14:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:83657919482210aa2afa437f7361ac5b12e8cb24edf161795481a9be123d774d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T23:12:10.133547Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":32,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2211.11501","last_updated":"2022-11-18T17:20:27Z","snapshot_observed_at":"2026-08-02T06:47:39.159537Z","submitted_at":"2022-11-18T17:20:27Z","title":"DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation","version":1},"cited_work":{"arxiv_id":"2211.11501","doi":"10.48550/arxiv.2211.11501","metadata_source":"pith","pith_arxiv_id":"2211.11501","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ds-1000: A natural and reliable bench- mark for data science code generation","venue":"cs.SE","work_id":"16d27f0f-e992-4a89-b3f3-a50dfca62314","year":2022},"citing_paper":{"arxiv_id":"2305.06161","last_updated":"2023-12-13T14:44:10Z","snapshot_observed_at":"2026-07-06T15:25:35.930688Z","submitted_at":"2023-05-09T08:16:42Z","title":"StarCoder: may the source be with you!","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-10T23:32:59.517389Z"},"links":{"cited_paper":"/paper/2211.11501","citing_paper":"/paper/2305.06161"},"observation_digest":"sha256:ee5c62a4386517b8f2183f99971e6a432fcdf563a5330868941b4ade94d5200c","observation_id":"8c7cb085-ff52-4f44-ae68-77835b03cf8f","resolution":{"observed_at":"2026-05-10T23:33:00.580246Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11501","last_updated":"2022-11-18T17:20:27Z","snapshot_observed_at":"2026-08-02T06:47:39.159537Z","submitted_at":"2022-11-18T17:20:27Z","title":"DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation","version":1},"cited_work":{"arxiv_id":"2211.11501","doi":"10.48550/arxiv.2211.11501","metadata_source":"pith","pith_arxiv_id":"2211.11501","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ds-1000: A natural and reliable bench- mark for data science code generation","venue":"cs.SE","work_id":"16d27f0f-e992-4a89-b3f3-a50dfca62314","year":2022},"citing_paper":{"arxiv_id":"2502.10517","last_updated":"2025-02-14T19:30:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T19:30:53Z","title":"KernelBench: Can LLMs Write Efficient GPU Kernels?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T16:55:01.976356Z"},"links":{"cited_paper":"/paper/2211.11501","citing_paper":"/paper/2502.10517"},"observation_digest":"sha256:d58551d2a645fc94875d2047fc434318d91ec067047f9876ca0aacd6dd8573c8","observation_id":"27bbfcb3-7018-411c-a5b5-354ac4f72ee7","resolution":{"observed_at":"2026-05-15T16:55:02.078492Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11501","last_updated":"2022-11-18T17:20:27Z","snapshot_observed_at":"2026-08-02T06:47:39.159537Z","submitted_at":"2022-11-18T17:20:27Z","title":"DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation","version":1},"cited_work":{"arxiv_id":"2211.11501","doi":"10.48550/arxiv.2211.11501","metadata_source":"pith","pith_arxiv_id":"2211.11501","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ds-1000: A natural and reliable bench- mark for data science code generation","venue":"cs.SE","work_id":"16d27f0f-e992-4a89-b3f3-a50dfca62314","year":2022},"citing_paper":{"arxiv_id":"2504.16397","last_updated":"2026-05-18T04:01:34Z","snapshot_observed_at":"2026-08-02T07:10:38.754825Z","submitted_at":"2025-04-23T03:57:24Z","title":"Compass: SLO-aware Query Planner for Compound AI Serving at Scale","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T19:14:58.225504Z"},"links":{"cited_paper":"/paper/2211.11501","citing_paper":"/paper/2504.16397"},"observation_digest":"sha256:650db2ed1d6fa800020567b673c89e3a82c6274a80c445b3bb217fa7f5b82be4","observation_id":"668d2008-d8df-4d5f-977d-139a42e8c8be","resolution":{"observed_at":"2026-05-22T19:15:03.477216Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11501","last_updated":"2022-11-18T17:20:27Z","snapshot_observed_at":"2026-08-02T06:47:39.159537Z","submitted_at":"2022-11-18T17:20:27Z","title":"DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation","version":1},"cited_work":{"arxiv_id":"2211.11501","doi":"10.48550/arxiv.2211.11501","metadata_source":"pith","pith_arxiv_id":"2211.11501","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ds-1000: A natural and reliable bench- mark for data science code generation","venue":"cs.SE","work_id":"16d27f0f-e992-4a89-b3f3-a50dfca62314","year":2022},"citing_paper":{"arxiv_id":"2506.08980","last_updated":"2026-04-24T10:45:51Z","snapshot_observed_at":"2026-07-31T18:53:54.954814Z","submitted_at":"2025-06-10T16:49:46Z","title":"AdaDec: A Uncertainty-Guided Lookahead Decoding Framework for LLM-Based Code Generation","version":5},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-19T10:19:07.701197Z"},"links":{"cited_paper":"/paper/2211.11501","citing_paper":"/paper/2506.08980"},"observation_digest":"sha256:c06d382a4102ed79991cb1ef5a863b610b3f256f913ac8b3ec7099767efad830","observation_id":"d84fe4d2-420b-41ec-bcea-f483217ede62","resolution":{"observed_at":"2026-05-19T10:22:14.544266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11501","last_updated":"2022-11-18T17:20:27Z","snapshot_observed_at":"2026-08-02T06:47:39.159537Z","submitted_at":"2022-11-18T17:20:27Z","title":"DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11501","snapshot_observed_at":"2026-08-04T23:12:10.133547Z","title":"Ds-1000: A natural and reliable benchmark for data science code generation, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.06770","last_updated":"2025-09-13T00:41:46Z","snapshot_observed_at":"2026-08-04T23:12:06.321542Z","submitted_at":"2025-09-08T14:54:31Z","title":"Another Turn, Better Output? A Turn-Wise Analysis of Iterative LLM Prompting","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T23:12:10.133547Z"},"links":{"cited_paper":"/paper/2211.11501","citing_paper":"/paper/2509.06770"},"observation_digest":"sha256:f1d273f66ad1f7f9dbad5feea98e4594ee6dabfd6c6839a92cc524a4f8dc8e6b","observation_id":"ca2aea44-5448-44db-9412-3c11550295ec","resolution":{"observed_at":"2026-08-04T23:12:10.133547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11501","last_updated":"2022-11-18T17:20:27Z","snapshot_observed_at":"2026-08-02T06:47:39.159537Z","submitted_at":"2022-11-18T17:20:27Z","title":"DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11501","snapshot_observed_at":"2026-08-03T14:21:27.673942Z","title":"Y uhang Lai, Chengxi Li, Yiming Wang, Tianyi Zhang, Ruiqi Zhong, Luke Zettlemoyer, Scott Wen tau Yih, Daniel Fried, Sida Wang, and Tao Y u","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.20732","last_updated":"2026-05-29T12:40:45Z","snapshot_observed_at":"2026-08-03T23:05:14.282754Z","submitted_at":"2025-12-23T19:40:51Z","title":"FEM-Bench: A Structured Scientific Reasoning Benchmark for Evaluating Code-Generating LLMs","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T14:21:27.673942Z"},"links":{"cited_paper":"/paper/2211.11501","citing_paper":"/paper/2512.20732"},"observation_digest":"sha256:fe7f37bf5bc86988e8c56865c9e7c22541c04d3d35d7e3ca5be42dea917c665f","observation_id":"094bf937-21f9-481b-9a99-6eb7103487ae","resolution":{"observed_at":"2026-08-03T14:21:27.673942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11501","last_updated":"2022-11-18T17:20:27Z","snapshot_observed_at":"2026-08-02T06:47:39.159537Z","submitted_at":"2022-11-18T17:20:27Z","title":"DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation","version":1},"cited_work":{"arxiv_id":"2211.11501","doi":"10.48550/arxiv.2211.11501","metadata_source":"pith","pith_arxiv_id":"2211.11501","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ds-1000: A natural and reliable bench- mark for data science code generation","venue":"cs.SE","work_id":"16d27f0f-e992-4a89-b3f3-a50dfca62314","year":2022},"citing_paper":{"arxiv_id":"2604.07769","last_updated":"2026-04-09T03:48:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T03:48:11Z","title":"An Empirical Study on Influence-Based Pretraining Data Selection for Code Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T18:13:24.750244Z"},"links":{"cited_paper":"/paper/2211.11501","citing_paper":"/paper/2604.07769"},"observation_digest":"sha256:7de4a5b2b673fecafbef5514df90b1afe6b36968d583757511effceb32351898","observation_id":"efd883dd-e383-46b6-b3ba-d8b8b6ea796d","resolution":{"observed_at":"2026-05-11T05:16:04.723845Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11501","last_updated":"2022-11-18T17:20:27Z","snapshot_observed_at":"2026-08-02T06:47:39.159537Z","submitted_at":"2022-11-18T17:20:27Z","title":"DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation","version":1},"cited_work":{"arxiv_id":"2211.11501","doi":"10.48550/arxiv.2211.11501","metadata_source":"pith","pith_arxiv_id":"2211.11501","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ds-1000: A natural and reliable bench- mark for data science code generation","venue":"cs.SE","work_id":"16d27f0f-e992-4a89-b3f3-a50dfca62314","year":2022},"citing_paper":{"arxiv_id":"2605.21338","last_updated":"2026-05-20T16:05:05Z","snapshot_observed_at":"2026-07-06T23:31:46.877766Z","submitted_at":"2026-05-20T16:05:05Z","title":"Text Analytics Evaluation Framework: A Case Study on LLMs and Social Media","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-21T04:52:44.897900Z"},"links":{"cited_paper":"/paper/2211.11501","citing_paper":"/paper/2605.21338"},"observation_digest":"sha256:dc22f7b675a4940c66a153d9fe91c430fb08884f57a372119b513a12baf907f6","observation_id":"3c9316af-cc64-4538-b307-15237d29eb72","resolution":{"observed_at":"2026-05-21T04:53:57.766148Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11501","last_updated":"2022-11-18T17:20:27Z","snapshot_observed_at":"2026-08-02T06:47:39.159537Z","submitted_at":"2022-11-18T17:20:27Z","title":"DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation","version":1},"cited_work":{"arxiv_id":"2211.11501","doi":"10.48550/arxiv.2211.11501","metadata_source":"pith","pith_arxiv_id":"2211.11501","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ds-1000: A natural and reliable bench- mark for data science code generation","venue":"cs.SE","work_id":"16d27f0f-e992-4a89-b3f3-a50dfca62314","year":2022},"citing_paper":{"arxiv_id":"2605.27210","last_updated":"2026-05-26T16:02:08Z","snapshot_observed_at":"2026-08-04T03:28:22.303695Z","submitted_at":"2026-05-26T16:02:08Z","title":"Qiskit QuantumKatas: Adapting Microsoft's Quantum Computing exercises for LLM evaluation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T16:36:03.557894Z"},"links":{"cited_paper":"/paper/2211.11501","citing_paper":"/paper/2605.27210"},"observation_digest":"sha256:6e79e157ddcd45810c1104c935e6cd21af50953f8c04090bc718450e9e523af9","observation_id":"3be13abe-42bc-4e41-965e-d5903b534d6d","resolution":{"observed_at":"2026-06-29T17:13:45.114907Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11501","last_updated":"2022-11-18T17:20:27Z","snapshot_observed_at":"2026-08-02T06:47:39.159537Z","submitted_at":"2022-11-18T17:20:27Z","title":"DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation","version":1},"cited_work":{"arxiv_id":"2211.11501","doi":"10.48550/arxiv.2211.11501","metadata_source":"pith","pith_arxiv_id":"2211.11501","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ds-1000: A natural and reliable bench- mark for data science code generation","venue":"cs.SE","work_id":"16d27f0f-e992-4a89-b3f3-a50dfca62314","year":2022},"citing_paper":{"arxiv_id":"2606.00051","last_updated":"2026-05-08T08:23:10Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-08T08:23:10Z","title":"Business Utility of Large Language Models as Exploratory Data Analysis Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T23:25:17.416071Z"},"links":{"cited_paper":"/paper/2211.11501","citing_paper":"/paper/2606.00051"},"observation_digest":"sha256:8234351811f87043200e99441b62c6d7469a19358777aa8db072553cba20e1db","observation_id":"0917a0c4-085e-4e28-b190-c667c33342aa","resolution":{"observed_at":"2026-06-30T23:35:06.926594Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11501","last_updated":"2022-11-18T17:20:27Z","snapshot_observed_at":"2026-08-02T06:47:39.159537Z","submitted_at":"2022-11-18T17:20:27Z","title":"DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation","version":1},"cited_work":{"arxiv_id":"2211.11501","doi":"10.48550/arxiv.2211.11501","metadata_source":"pith","pith_arxiv_id":"2211.11501","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ds-1000: A natural and reliable bench- mark for data science code generation","venue":"cs.SE","work_id":"16d27f0f-e992-4a89-b3f3-a50dfca62314","year":2022},"citing_paper":{"arxiv_id":"2606.03800","last_updated":"2026-07-07T21:08:01Z","snapshot_observed_at":"2026-08-01T03:27:17.690944Z","submitted_at":"2026-06-02T15:48:28Z","title":"Trading Human Curation for Synthetic Augmentation in RLVR","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T11:10:06.685591Z"},"links":{"cited_paper":"/paper/2211.11501","citing_paper":"/paper/2606.03800"},"observation_digest":"sha256:0e8a75a4a02a654d2bffc2cbb46730ae37e4888b30e32be587cbf057a8dbffed","observation_id":"0533b7e3-9e13-4b24-b2c8-3755a53e79a3","resolution":{"observed_at":"2026-07-02T02:16:26.188241Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11501","last_updated":"2022-11-18T17:20:27Z","snapshot_observed_at":"2026-08-02T06:47:39.159537Z","submitted_at":"2022-11-18T17:20:27Z","title":"DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11501","snapshot_observed_at":"2026-07-12T15:15:09.675778Z","title":"W., Fried, D., Wang, S., and Yu, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.03800","last_updated":"2026-07-07T21:08:01Z","snapshot_observed_at":"2026-08-01T03:27:17.690944Z","submitted_at":"2026-06-02T15:48:28Z","title":"Trading Human Curation for Synthetic Augmentation in RLVR","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T15:15:09.675778Z"},"links":{"cited_paper":"/paper/2211.11501","citing_paper":"/paper/2606.03800"},"observation_digest":"sha256:f8094b55c2861811eac22ad99996e6d6768a60b20f0291c5e6a84c8a1ea8e801","observation_id":"7396d710-d0fa-4da8-b2aa-53d056176a99","resolution":{"observed_at":"2026-07-12T15:15:09.675778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11501","last_updated":"2022-11-18T17:20:27Z","snapshot_observed_at":"2026-08-02T06:47:39.159537Z","submitted_at":"2022-11-18T17:20:27Z","title":"DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation","version":1},"cited_work":{"arxiv_id":"2211.11501","doi":"10.48550/arxiv.2211.11501","metadata_source":"pith","pith_arxiv_id":"2211.11501","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ds-1000: A natural and reliable bench- mark for data science code generation","venue":"cs.SE","work_id":"16d27f0f-e992-4a89-b3f3-a50dfca62314","year":2022},"citing_paper":{"arxiv_id":"2606.08676","last_updated":"2026-06-07T15:24:30Z","snapshot_observed_at":"2026-07-06T23:48:07.065806Z","submitted_at":"2026-06-07T15:24:30Z","title":"Lost in the Flow with Code Talkers: Unveiling the Instruction-Tuning Tax of Large Language Models in Code Tasks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T18:00:58.780753Z"},"links":{"cited_paper":"/paper/2211.11501","citing_paper":"/paper/2606.08676"},"observation_digest":"sha256:1c3533360ab49075e175ee11aa30f8956fbe1f8067843bf9bbaf40b78c8832ae","observation_id":"605d2bd8-af86-439b-b005-7983413f1997","resolution":{"observed_at":"2026-07-02T23:47:27.337067Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11501","last_updated":"2022-11-18T17:20:27Z","snapshot_observed_at":"2026-08-02T06:47:39.159537Z","submitted_at":"2022-11-18T17:20:27Z","title":"DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation","version":1},"cited_work":{"arxiv_id":"2211.11501","doi":"10.48550/arxiv.2211.11501","metadata_source":"pith","pith_arxiv_id":"2211.11501","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ds-1000: A natural and reliable bench- mark for data science code generation","venue":"cs.SE","work_id":"16d27f0f-e992-4a89-b3f3-a50dfca62314","year":2022},"citing_paper":{"arxiv_id":"2607.07504","last_updated":"2026-07-08T15:00:16Z","snapshot_observed_at":"2026-08-05T12:40:48.129297Z","submitted_at":"2026-07-08T15:00:16Z","title":"Do LLM-Generated Skills Make Better AI Data Scientists? A Component Ablation Across Data-Science Workflows","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-09T09:01:10.366890Z"},"links":{"cited_paper":"/paper/2211.11501","citing_paper":"/paper/2607.07504"},"observation_digest":"sha256:c7a40d721e14963a59e1ff48e32f843661b47ad632d39566147dbf9f22634dd1","observation_id":"7f27b98f-55ae-40d6-acc9-06c9a92c1442","resolution":{"observed_at":"2026-07-09T09:06:06.133830Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11501","last_updated":"2022-11-18T17:20:27Z","snapshot_observed_at":"2026-08-02T06:47:39.159537Z","submitted_at":"2022-11-18T17:20:27Z","title":"DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11501","snapshot_observed_at":"2026-07-31T19:54:08.464457Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.464457Z"},"links":{"cited_paper":"/paper/2211.11501","citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:fcf81ef521e373bc816683fecb9ff8ade609e8d7219ac0df8fea28da89f36b9b","observation_id":"0a012d1b-edcd-4d54-9df8-89d2170e8017","resolution":{"observed_at":"2026-07-31T19:54:08.464457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2211.11501/citation-record","integrity":"/paper/2211.11501/integrity","json":"/paper/2211.11501/citation-record.json","paper":"/paper/2211.11501"},"outbound":[],"paper":{"arxiv_id":"2211.11501","last_updated":"2022-11-18T17:20:27Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-02T06:47:39.159537Z","submitted_at":"2022-11-18T17:20:27Z","title":"DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 15 inbound Pith citation observations for arXiv:2211.11501."}