Pith. sign in

Paper Citation Record · LEDGER

How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence

As of 10 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 5 inbound Pith citation observations for arXiv:2502.00678.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2502.00678 v2

Coverage vector

measured 26 of 26 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-09T18:11:35.098478Z

measured 31 of 31 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-10T06:31:04.303077+00:00

measured 5 of 5 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-06T22:35:11.856700Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-02T20:57:23.351502Z

Reference resolution

26 of 26 outbound references displayed

  • verified exact1
  • verified fuzzy11
  • unresolved14
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation bb849fbc-970b-4e1b-ab44-338ff21a7591 · outbound

This paper cites Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone.

How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-09T18:11:34.947486Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T18:11:34.947486Z digest=sha256:94988540f4c5fcd03a710cd662c6de39c40c47d9ca5302ede8f31d0cf1a05b43

Observation bfa9bf10-aa11-43b1-a081-2afb92c7fc09 · outbound

This paper cites (Zhang et al., 2024b) Following the general guideline from Shi et al.

How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence (Zhang et al., 2024b) Following the general guideline from Shi et al

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T18:11:35.436601Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T18:11:35.084471Z digest=sha256:1ac7a2c17f3fad6e8e0331f3e9ce579980273334ea622738ffbfc783fb48da15

Observation 879901bd-1977-4398-ada3-dc5b43f38fe9 · outbound

This paper cites The Llama 3 Herd of Models.

How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence The Llama 3 Herd of Models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-09T18:11:34.970153Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T18:11:34.970153Z digest=sha256:f0ee88403568c2e388e9e30eab0c54ced3bf47bf2a7bc3f047cc715114d6362a

Observation 4a46c49a-6714-4e3d-a5e7-131cff9d6377 · outbound

This paper cites an unresolved cited work.

How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence Unresolved cited work

Reference 7

Resolution
unresolved
raw_fallback, observed 2026-08-09T18:11:35.406481Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T18:11:35.098478Z digest=sha256:33f3256120b2d97795dfb05ca445338d5aa8b49ac1922adaeb291976af2b023f

Observation 887b68ba-8e61-4389-9e2b-5ef7506c35d2 · outbound

This paper cites Mistral 7B.

How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence Mistral 7B

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-09T18:11:34.987432Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T18:11:34.987432Z digest=sha256:4eab855a06a0d7d5ebe55a338dcfdc915fd48735aa7131a851cce917c8c07b82

Observation 0adbbb53-c35e-49db-8669-51a7c8fe38d5 · outbound

This paper cites LLM Dataset Inference: Did you train on my dataset?.

How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence LLM Dataset Inference: Did you train on my dataset?

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-09T18:11:34.998168Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T18:11:34.998168Z digest=sha256:c182ce49c1c49c810718d36c10bf0a0ecd4636dfafa23b2bf5dfd42898d195aa

Observation 09105b28-314f-49fe-a8a7-607fd01f4691 · outbound

This paper cites Membership inference attacks against language models via neighbourhood comparison.

How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence Membership inference attacks against language models via neighbourhood comparison

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T18:11:35.565685Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T18:11:35.003361Z digest=sha256:49fdf8974783dc43fa9029035366f06e5a8137031d259a8422b64492ddca15c8

Observation 8405e8ad-d6e8-4f2f-ad6f-30c73754bd17 · outbound

This paper cites SoK: Membership Inference Attacks on LLMs are Rushing Nowhere (and How to Fix It).

How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence SoK: Membership Inference Attacks on LLMs are Rushing Nowhere (and How to Fix It)

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-09T18:11:35.009058Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T18:11:35.009058Z digest=sha256:16d5f98d158157071329bf13ab59025ba23d36ab294ee23690904ff8cac0f9df

Observation 3f0a361d-ecfc-4827-802d-c2cc8e15f1bb · outbound

This paper cites Ml-leaks: Model and data independent membership inference attacks and defenses on machine learning models.

How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence Ml-leaks: Model and data independent membership inference attacks and defenses on machine learning models

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T18:11:35.549603Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T18:11:35.014747Z digest=sha256:18dad87047197123d9a1b442d3f7160daaf61672c9ad163a98debe4f545e1f42

Observation 015c0602-a631-469f-a2ce-6142c3a11e43 · outbound

This paper cites Membership inference attacks against machine learning models.

How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence Membership inference attacks against machine learning models

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T18:11:35.533665Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T18:11:35.019574Z digest=sha256:0562c24aa02cd914591bf45a8b41dd2166898051d3db5489dcd22da5c3cba0e9

Observation 44cd797b-fed2-446f-bc3f-1e6a6442aea9 · outbound

This paper cites Benchmark Data Contamination of Large Language Models: A Survey.

How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence Benchmark Data Contamination of Large Language Models: A Survey

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-09T18:11:35.035966Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T18:11:35.035966Z digest=sha256:a02085a219420d8fb9ab3ddb136fb7303e4e4938aac44c2bbddb167be98a3d2e

Observation f0d39c96-8140-4530-b269-887097046d2b · outbound

This paper cites Rethinking Benchmark and Contamination for Language Models with Rephrased Samples.

How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence Rethinking Benchmark and Contamination for Language Models with Rephrased Samples

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-09T18:11:35.042417Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T18:11:35.042417Z digest=sha256:8bfe9038a87ab1790556c8cfc0032c6e8d98f7bd571fb6ebd0f3e9e3d54010d4

Observation ef5ef6ad-6de3-4432-8b49-7de7271cd8cd · outbound

This paper cites Data Contamination Calibration for Black-box LLMs.

How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence Data Contamination Calibration for Black-box LLMs

Reference 19

Resolution
verified exact
local_arxiv, observed 2026-08-09T18:11:35.184580Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T18:11:35.048213Z digest=sha256:1288d76bca7b9f097e03fb307d7d90a0ba1e9674ac48421a3273589a2883fbdf

Observation 3fa586d9-50da-44e0-8a06-152d79c0206f · outbound

This paper cites Privacy risk in machine learning: Analyzing the connection to overfitting.

How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence Privacy risk in machine learning: Analyzing the connection to overfitting

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T18:11:35.486631Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T18:11:35.053559Z digest=sha256:3b7432fd5050e55b9a1ccffd1fcd72d3e197beba90dcc2e79406784c4cc69f14

Observation 90dc6e0b-1c27-47db-b0e2-33779ca6362a · outbound

This paper cites 12 A.2 Baseline Definitions.

How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence 12 A.2 Baseline Definitions

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T18:11:35.452800Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T18:11:35.076722Z digest=sha256:9777c657fbd3f9bf4f885ad35998f6897703899c59605bac7120ad919bca2706

Observation 7cc0da30-7910-492c-8f4b-1c580a7f0c9c · outbound

This paper cites The average Mean Absolute Percentage Error (MAPE) over 5 independent runs is calculated.

How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence The average Mean Absolute Percentage Error (MAPE) over 5 independent runs is calculated

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T18:11:35.421671Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T18:11:35.091111Z digest=sha256:7c0d20211a24cddb0170dd87d137a93e6fb343b83759f415ddbd5e7decd14315

Observation 30daf7d6-c258-4f91-91bc-5eba05eb9b59 · outbound

This paper cites The Pile: An 800GB Dataset of Diverse Text for Language Modeling.

How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence The Pile: An 800GB Dataset of Diverse Text for Language Modeling

Reference 2008

Resolution
unresolved
no resolver link, observed 2026-08-09T18:11:34.975510Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T18:11:34.975510Z digest=sha256:dc6722c1f632a4a4a7cc20dd1a005a78c853fb0482f155d7bb83e395682fa91d

Observation 92f9f1af-368d-4e0a-9966-cbe9e650b31a · outbound

This paper cites E., Yu, L., and Wei, W.

How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence E., Yu, L., and Wei, W

Reference 2017

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T18:11:35.518051Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T18:11:35.025123Z digest=sha256:731927a3bb487a0db3c7f257dc4b74e87c713b99b8fc8ebe49a22159b332970d

Observation 8e4155d1-edb0-487b-ae2e-ba55cb706357 · outbound

This paper cites Pacost: Paired confidence signifi- cance testing for benchmark contamination detection in large language models.

How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence Pacost: Paired confidence signifi- cance testing for benchmark contamination detection in large language models

Reference 2018

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T18:11:35.468730Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T18:11:35.060786Z digest=sha256:c24d397a615ae272a1668fb51b0eb134a444682be9e8a0d420fb49117cfe4957

Observation a7e9ed35-e4ff-4327-8cfb-c9b365c15e7a · outbound

This paper cites Recall: Membership inference via relative conditional log-likelihoods.

How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence Recall: Membership inference via relative conditional log-likelihoods

Reference 2019

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T18:11:35.502641Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T18:11:35.030199Z digest=sha256:82106293d712dcd1f21a2c3438dd929395634c02bdbd8378eeed41272bf7366b

Observation 8b640970-a1ca-483a-85f8-e72e513ae93f · outbound

This paper cites Large sample analysis of the median heuristic.

How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence Large sample analysis of the median heuristic

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-09T18:11:34.981613Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T18:11:34.981613Z digest=sha256:e739a60272faf8d7557062e3d9e80a4ed83b7b95f3cafb7b7f9f206ba6f067e7

Observation d5dd60fc-049e-4416-9e02-b4915a6c2127 · outbound

This paper cites Membership inference attacks from first principles.

How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence Membership inference attacks from first principles

Reference 2021

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T18:11:35.580716Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T18:11:34.953153Z digest=sha256:2461343992d1acd1c008c0fb1169a33bc9e3c4343089a8e411b2445f6e492523

Observation 50c0aa63-13be-43e9-b518-401304874202 · outbound

This paper cites Blind Baselines Beat Membership Inference Attacks for Foundation Models.

How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence Blind Baselines Beat Membership Inference Attacks for Foundation Models

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-09T18:11:34.958297Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T18:11:34.958297Z digest=sha256:c39067ecaaf7c09b794be505b9e3eeffde4bffc406af72780e503ebd5315da4a

Observation 033cd38c-224c-43f2-9ddd-98674589c3f8 · outbound

This paper cites Estimating Contamination via Perplexity: Quantifying Memorisation in Language Model Evaluation.

How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence Estimating Contamination via Perplexity: Quantifying Memorisation in Language Model Evaluation

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-09T18:11:34.992365Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T18:11:34.992365Z digest=sha256:bb4a6b54ef9998f785db0ef4fc46fed0b240f62194045f6c0ec046af47d65dc4

Observation 57b9cc5d-0258-4efa-9f55-6067991adbed · outbound

This paper cites Do Membership Inference Attacks Work on Large Language Models?.

How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence Do Membership Inference Attacks Work on Large Language Models?

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-09T18:11:34.963750Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T18:11:34.963750Z digest=sha256:de42e3e9c7d7e570522e289019c8e27e84a28bad18c06dc1e8aa3c0e8cb28095

Observation f43d9dd4-aadf-4745-abd3-8350063f0700 · outbound

This paper cites Min-K%++: Improved Baseline for Detecting Pre-Training Data from Large Language Models.

How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence Min-K%++: Improved Baseline for Detecting Pre-Training Data from Large Language Models

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-09T18:11:35.067065Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T18:11:35.067065Z digest=sha256:c1c6da71e4065a73996df16c2d07fe7d2607b777e7282133b04bc4363bf5e7bc

Pith citing papers

Observation 5730a9c4-46ad-4ad3-b5e8-92b0d06bd75d · inbound

Maintaining MTEB: Towards Long Term Usability and Reproducibility of Embedding Benchmarks cites this paper.

Maintaining MTEB: Towards Long Term Usability and Reproducibility of Embedding Benchmarks How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-06T22:35:11.856700Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T22:35:11.856700Z digest=sha256:2f8fb731356eed51868f88aec8d0f380972300ca12896de6f27f9c8c35f8bc85

Observation de39f1bc-94b6-4e53-b903-ba3bd58af580 · inbound

The Economics of AI Training Data: A Research Agenda cites this paper.

The Economics of AI Training Data: A Research Agenda How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-04T07:40:11.897460Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T07:40:11.897460Z digest=sha256:0224064531928155179e6963f1d42c816f41a872b848619b6210673f333adc6c

Observation 8d26c43a-aedc-4344-8d11-af3667d41ce5 · inbound

When Agents Look the Same: Quantifying Distillation-Induced Similarity in Tool-Use Behaviors cites this paper.

When Agents Look the Same: Quantifying Distillation-Induced Similarity in Tool-Use Behaviors How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-05-11T14:16:18.222490Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-09T22:07:58.614654Z digest=sha256:0d970f56aa89d60ed3470ff7c722add8bd24b1a7242a36319d45045501c44889

Observation a86d04d6-a9a5-46c5-93c1-0cab8b5a3bee · inbound

Beyond Goodhart's Law: A Dynamic Benchmark for Evaluating Compliance in Multi-Agent Systems cites this paper.

Beyond Goodhart's Law: A Dynamic Benchmark for Evaluating Compliance in Multi-Agent Systems How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence

Reference 13

Resolution
verified exact
arxiv_id, observed 2026-07-02T17:47:17.785130Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-06-27T21:53:37.616447Z digest=sha256:8dea0ee52b561526003e3d70f695d3fcf291f70c6c306de6efd9588d1278d6bf

Observation 115f0cf7-4813-46ac-9c84-79ba0c1a5787 · inbound

MC-PDD: Masked Corpus-Level Pretraining Data Detection for Black-Box Large Language Models cites this paper.

MC-PDD: Masked Corpus-Level Pretraining Data Detection for Black-Box Large Language Models How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence

Reference 14

Resolution
metadata mismatch
arxiv_id, observed 2026-07-02T20:57:23.353100Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-06-27T20:02:50.169589Z digest=sha256:7f57e84a69c699810c08a0b42afa6b9018f950ad614f3333a84d0d220714a00c