Pith. sign in

Paper Citation Record · LEDGER

DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation

As of 5 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 15 inbound Pith citation observations for arXiv:2211.11501.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2211.11501 v1

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 15 of 15 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-05T06:32:48.257954+00:00

measured 15 of 15 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-04T23:12:10.133547Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-08-05T02:28:24.338817Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

32
pith, observed 2026-08-05T02:28:24.338817Z

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation 8c7cb085-ff52-4f44-ae68-77835b03cf8f · inbound

StarCoder: may the source be with you! cites this paper.

StarCoder: may the source be with you! DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation

Reference 57

Resolution
verified exact
arxiv_id, observed 2026-05-10T23:33:00.580246Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-05-10T23:32:59.517389Z digest=sha256:ee5c62a4386517b8f2183f99971e6a432fcdf563a5330868941b4ade94d5200c

Observation 27bbfcb3-7018-411c-a5b5-354ac4f72ee7 · inbound

KernelBench: Can LLMs Write Efficient GPU Kernels? cites this paper.

KernelBench: Can LLMs Write Efficient GPU Kernels? DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation

Reference 17

Resolution
verified exact
arxiv_id, observed 2026-05-15T16:55:02.078492Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-15T16:55:01.976356Z digest=sha256:d58551d2a645fc94875d2047fc434318d91ec067047f9876ca0aacd6dd8573c8

Observation 668d2008-d8df-4d5f-977d-139a42e8c8be · inbound

Compass: SLO-aware Query Planner for Compound AI Serving at Scale cites this paper.

Compass: SLO-aware Query Planner for Compound AI Serving at Scale DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation

Reference 21

Resolution
verified exact
arxiv_id, observed 2026-05-22T19:15:03.477216Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-22T19:14:58.225504Z digest=sha256:650db2ed1d6fa800020567b673c89e3a82c6274a80c445b3bb217fa7f5b82be4

Observation d84fe4d2-420b-41ec-bcea-f483217ede62 · inbound

AdaDec: A Uncertainty-Guided Lookahead Decoding Framework for LLM-Based Code Generation cites this paper.

AdaDec: A Uncertainty-Guided Lookahead Decoding Framework for LLM-Based Code Generation DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation

Reference 37

Resolution
verified exact
arxiv_id, observed 2026-05-19T10:22:14.544266Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T10:19:07.701197Z digest=sha256:c06d382a4102ed79991cb1ef5a863b610b3f256f913ac8b3ec7099767efad830

Observation ca2aea44-5448-44db-9412-3c11550295ec · inbound

Another Turn, Better Output? A Turn-Wise Analysis of Iterative LLM Prompting cites this paper.

Another Turn, Better Output? A Turn-Wise Analysis of Iterative LLM Prompting DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-04T23:12:10.133547Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T23:12:10.133547Z digest=sha256:f1d273f66ad1f7f9dbad5feea98e4594ee6dabfd6c6839a92cc524a4f8dc8e6b

Observation 094bf937-21f9-481b-9a99-6eb7103487ae · inbound

FEM-Bench: A Structured Scientific Reasoning Benchmark for Evaluating Code-Generating LLMs cites this paper.

FEM-Bench: A Structured Scientific Reasoning Benchmark for Evaluating Code-Generating LLMs DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-03T14:21:27.673942Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:21:27.673942Z digest=sha256:fe7f37bf5bc86988e8c56865c9e7c22541c04d3d35d7e3ca5be42dea917c665f

Observation efd883dd-e383-46b6-b3ba-d8b8b6ea796d · inbound

An Empirical Study on Influence-Based Pretraining Data Selection for Code Large Language Models cites this paper.

An Empirical Study on Influence-Based Pretraining Data Selection for Code Large Language Models DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-05-11T05:16:04.723845Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T18:13:24.750244Z digest=sha256:7de4a5b2b673fecafbef5514df90b1afe6b36968d583757511effceb32351898

Observation 3c9316af-cc64-4538-b307-15237d29eb72 · inbound

Text Analytics Evaluation Framework: A Case Study on LLMs and Social Media cites this paper.

Text Analytics Evaluation Framework: A Case Study on LLMs and Social Media DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation

Reference 83

Resolution
verified exact
arxiv_id, observed 2026-05-21T04:53:57.766148Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-05-21T04:52:44.897900Z digest=sha256:dc22f7b675a4940c66a153d9fe91c430fb08884f57a372119b513a12baf907f6

Observation 3be13abe-42bc-4e41-965e-d5903b534d6d · inbound

Qiskit QuantumKatas: Adapting Microsoft's Quantum Computing exercises for LLM evaluation cites this paper.

Qiskit QuantumKatas: Adapting Microsoft's Quantum Computing exercises for LLM evaluation DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation

Reference 3

Resolution
verified exact
arxiv_id, observed 2026-06-29T17:13:45.114907Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T16:36:03.557894Z digest=sha256:6e79e157ddcd45810c1104c935e6cd21af50953f8c04090bc718450e9e523af9

Observation 0917a0c4-085e-4e28-b190-c667c33342aa · inbound

Business Utility of Large Language Models as Exploratory Data Analysis Agents cites this paper.

Business Utility of Large Language Models as Exploratory Data Analysis Agents DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation

Reference 18

Resolution
metadata mismatch
arxiv_id, observed 2026-06-30T23:35:06.926594Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-30T23:25:17.416071Z digest=sha256:8234351811f87043200e99441b62c6d7469a19358777aa8db072553cba20e1db

Observation 0533b7e3-9e13-4b24-b2c8-3755a53e79a3 · inbound

Trading Human Curation for Synthetic Augmentation in RLVR cites this paper.

Trading Human Curation for Synthetic Augmentation in RLVR DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation

Reference 11

Resolution
metadata mismatch
arxiv_id, observed 2026-07-02T02:16:26.188241Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-28T11:10:06.685591Z digest=sha256:0e8a75a4a02a654d2bffc2cbb46730ae37e4888b30e32be587cbf057a8dbffed

Observation 7396d710-d0fa-4da8-b2aa-53d056176a99 · inbound

Trading Human Curation for Synthetic Augmentation in RLVR cites this paper.

Trading Human Curation for Synthetic Augmentation in RLVR DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation

Reference 11

Resolution
unresolved
no resolver link, observed 2026-07-12T15:15:09.675778Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T15:15:09.675778Z digest=sha256:f8094b55c2861811eac22ad99996e6d6768a60b20f0291c5e6a84c8a1ea8e801

Observation 605d2bd8-af86-439b-b005-7983413f1997 · inbound

Lost in the Flow with Code Talkers: Unveiling the Instruction-Tuning Tax of Large Language Models in Code Tasks cites this paper.

Lost in the Flow with Code Talkers: Unveiling the Instruction-Tuning Tax of Large Language Models in Code Tasks DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation

Reference 23

Resolution
verified exact
arxiv_id, observed 2026-07-02T23:47:27.337067Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-27T18:00:58.780753Z digest=sha256:1c3533360ab49075e175ee11aa30f8956fbe1f8067843bf9bbaf40b78c8832ae

Observation 7f27b98f-55ae-40d6-acc9-06c9a92c1442 · inbound

Do LLM-Generated Skills Make Better AI Data Scientists? A Component Ablation Across Data-Science Workflows cites this paper.

Do LLM-Generated Skills Make Better AI Data Scientists? A Component Ablation Across Data-Science Workflows DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation

Reference 5

Resolution
verified exact
local_arxiv, observed 2026-07-09T09:06:06.133830Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-07-09T09:01:10.366890Z digest=sha256:d0add6468a6b7db20f8f8d7e02b19c87a1110c61db3360b4484c6b40446976b8

Observation 0a012d1b-edcd-4d54-9df8-89d2170e8017 · inbound

DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness cites this paper.

DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation

Reference 18

Resolution
unresolved
no resolver link, observed 2026-07-31T19:54:08.464457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T19:54:08.464457Z digest=sha256:fcf81ef521e373bc816683fecb9ff8ade609e8d7219ac0df8fea28da89f36b9b