Pith. sign in

Paper Citation Record · LEDGER

Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models

As of 5 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2606.26101.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2606.26101 v1

Coverage vector

measured 23 of 23 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-07-11T11:50:26.030339Z

measured 23 of 23 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-05T06:32:48.257954+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

23 of 23 outbound references displayed

  • verified exact8
  • verified fuzzy3
  • unresolved0
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch11

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 1571246f-11f3-4006-b6dc-0ca715a1708b · outbound

This paper cites Scaling Instruction-Finetuned Language Models.

Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models Scaling Instruction-Finetuned Language Models

Reference 1

Resolution
metadata mismatch
local_arxiv, observed 2026-07-01T09:05:36.957648Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-07-01T08:57:27.245873Z digest=sha256:0171d71a9b1d3b8e80fda102a45b56859d9869a3c5f8e42bdc48c8d37e2b7e59

Observation 4705e333-1be6-41ef-92e9-d7cde28a5d5f · outbound

This paper cites Generalization or Memorization: Data Contamination and Trustworthy Evaluation for Large Language Models.

Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models Generalization or Memorization: Data Contamination and Trustworthy Evaluation for Large Language Models

Reference 2

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T09:05:36.963144Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-07-01T08:57:27.245873Z digest=sha256:f2eb0de80c29416191783ad218c0e8420b88e7d1fb6dcbfd2ee5e5563c5d860a

Observation d5bff1e0-f52f-450c-ae9b-1fbed211e777 · outbound

This paper cites URL https://cacm.acm.org/research/ datasheets-for-datasets/.

Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models URL https://cacm.acm.org/research/ datasheets-for-datasets/

Reference 3

Resolution
verified exact
doi, observed 2026-07-01T09:05:36.080875Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-07-01T08:57:27.245873Z digest=sha256:df00f926c2cc6822795cef5a514d33623f10b6976006150cdd9c2d1640962a3e

Observation 6008bf2a-5605-468b-8293-4bf32457fcf4 · outbound

This paper cites In: Proceedings of the 36th International Conference on Ma- chine Learning.

Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models In: Proceedings of the 36th International Conference on Ma- chine Learning

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-07-06T12:22:26.594491Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-07-01T08:57:27.245873Z digest=sha256:518d563e8552736ba0ea92648aaece2f49c18f0f44ea849925a95e1f36375ac9

Observation 85f0cd48-cf01-4545-a83c-0e1232f8c578 · outbound

This paper cites The Llama 3 Herd of Models.

Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models The Llama 3 Herd of Models

Reference 5

Resolution
metadata mismatch
local_arxiv, observed 2026-07-01T09:05:36.948534Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-07-01T08:57:27.245873Z digest=sha256:3c79c31c1d24ac9e15edcf598cfa167ae7cf0b1c7af2883696384abdcff6fa79

Observation 7a8fc836-2e68-40d1-82db-e81a59a3c42f · outbound

This paper cites In: Proceedings of the 34th International Conference on Machine Learn- ing.

Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models In: Proceedings of the 34th International Conference on Machine Learn- ing

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-07-06T12:22:26.600414Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-07-01T08:57:27.245873Z digest=sha256:462c013709a2514a3588d0f4599021bbbccc4d34cbc82cc2e731769496d7fffb

Observation ac973313-5ea8-44e9-b397-1c69f7e586a5 · outbound

This paper cites TriviaQA: A large scale distantly supervised challenge dataset for reading comprehension.

Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models TriviaQA: A large scale distantly supervised challenge dataset for reading comprehension

Reference 7

Resolution
metadata mismatch
doi, observed 2026-07-01T09:05:36.092963Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-07-01T08:57:27.245873Z digest=sha256:effb49dbffefe38d4ec49f01f136db5dbcdaafdac036e4906720b039599b5612

Observation 43e3f1a1-1eb9-4ea9-b83e-ec31f698ee5a · outbound

This paper cites Language Models (Mostly) Know What They Know.

Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models Language Models (Mostly) Know What They Know

Reference 8

Resolution
metadata mismatch
local_arxiv, observed 2026-07-01T09:05:36.954309Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-07-01T08:57:27.245873Z digest=sha256:c5912b1321c34da388dc259e2ae74798591b71212a28c27b2ce33f3b75184733

Observation 8bbd5728-5fed-4585-a0e9-8132360b2f11 · outbound

This paper cites HaluEval: A Large-Scale Hallucination Evaluation Benchmark for Large Language Models.

Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models HaluEval: A Large-Scale Hallucination Evaluation Benchmark for Large Language Models

Reference 9

Resolution
verified exact
doi, observed 2026-07-01T09:05:36.102516Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-07-01T08:57:27.245873Z digest=sha256:6be72da55a592d28546e09123c7b99e0592e8f5955b7158ec2228cb9ee7b7c9e

Observation ee1fb371-3321-4279-87c4-dfa4abf9d5fc · outbound

This paper cites In: Pro- ceedings of the AAAIConference on Artificial Intelligence.vol.

Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models In: Pro- ceedings of the AAAIConference on Artificial Intelligence.vol

Reference 10

Resolution
verified exact
doi, observed 2026-07-01T09:05:36.089862Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-07-01T08:57:27.245873Z digest=sha256:ec6e3e6f20edd53eee3a3954e15063497b224c28995fc6d51aa4ba14cdb6fe5f

Observation 17f0b81a-0a05-4539-be7f-14216fbb031d · outbound

This paper cites An open-source data contamination report for large language models.

Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models An open-source data contamination report for large language models

Reference 11

Resolution
verified exact
doi, observed 2026-07-01T09:05:36.076301Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-07-01T08:57:27.245873Z digest=sha256:1e2e3d25e53850d2f196703d4b400aa904ded7a24f277dc9666c58a260c0b513

Observation 5be028f1-7993-4a7f-9640-1c42cd084527 · outbound

This paper cites Holistic Evaluation of Language Models.

Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models Holistic Evaluation of Language Models

Reference 12

Resolution
metadata mismatch
local_arxiv, observed 2026-07-01T09:05:36.959322Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-07-01T08:57:27.245873Z digest=sha256:fd3437e67fe2a8dcfacb5b3a3885d3b8e915e31e0234025e83a7882a35e8ae30

Observation 54a8626c-1d8b-4f96-aeb6-3357f1287fc8 · outbound

This paper cites In: Proceedings of the 60th Annual Meeting of the Association for Com- putational Linguistics (Volume 1: Long Papers).

Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models In: Proceedings of the 60th Annual Meeting of the Association for Com- putational Linguistics (Volume 1: Long Papers)

Reference 13

Resolution
malformed identifier
raw_fallback, observed 2026-07-06T12:22:26.598419Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-07-01T08:57:27.245873Z digest=sha256:d01ce4eb47708fd9fc2d903fc7547a034ec7dd4bf378c70a3cc19a86b61a0df5

Observation 2fd13d21-f553-42b2-95d4-344f09233a54 · outbound

This paper cites In: Proceedings of the Conference on Health, Inference, and Learning.

Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models In: Proceedings of the Conference on Health, Inference, and Learning

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-07-06T12:22:26.596592Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-07-01T08:57:27.245873Z digest=sha256:a5e744d8650b47ccca896dd1cb16ae549d76d64ded143db743c46dd41fcf81cf

Observation 07dc27c9-6851-4d9c-a1d6-a7d5a27f8cb7 · outbound

This paper cites In: Proceedings of the 1st Workshop on Data Contamination (CONDA).

Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models In: Proceedings of the 1st Workshop on Data Contamination (CONDA)

Reference 15

Resolution
verified exact
doi, observed 2026-07-01T09:05:36.083472Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-07-01T08:57:27.245873Z digest=sha256:e7df8b4ec3b2d3b88bc92b5c02eafec66fe532fcf0ea98603ce4f23e6e4d8fe9

Observation 3d69a9d5-d1d2-4455-b0f6-b523c249539d · outbound

This paper cites Qwen2.5 Technical Report.

Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models Qwen2.5 Technical Report

Reference 16

Resolution
metadata mismatch
local_arxiv, observed 2026-07-01T09:05:36.947075Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-07-01T08:57:27.245873Z digest=sha256:39cddb13639395e600720c2a18b282b4204ebdc4cf38a29f59a6fc7e9cee34fc

Observation 4c629551-4019-4d39-b795-cdc02127514d · outbound

This paper cites doi: 10.18653/v1/n19-1421.

Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models doi: 10.18653/v1/n19-1421

Reference 17

Resolution
metadata mismatch
doi, observed 2026-07-01T09:05:36.088118Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-07-01T08:57:27.245873Z digest=sha256:7f881cc32c9bdc7abacf193eec00e913cc79211a6335534c41126aa52850a87b

Observation 0fefe833-0213-4d9c-a043-21a0ff7b4c41 · outbound

This paper cites In: Proceedings of the 7th Workshop on Representation Learn- ing for NLP.

Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models In: Proceedings of the 7th Workshop on Representation Learn- ing for NLP

Reference 18

Resolution
verified exact
doi, observed 2026-07-01T09:05:36.098832Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-07-01T08:57:27.245873Z digest=sha256:987debba17bb557d66a2e55a7b3a85c27b51229334ed9543bc973eddd93f13e8

Observation 7969dd46-8397-46ee-9368-440a89cde1fb · outbound

This paper cites Unveiling the achilles’ heel of NLG evaluators: A unified adversarial framework driven by large language models.

Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models Unveiling the achilles’ heel of NLG evaluators: A unified adversarial framework driven by large language models

Reference 19

Resolution
verified exact
doi, observed 2026-07-01T09:05:36.071473Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-07-01T08:57:27.245873Z digest=sha256:76d33a8c2f0a8e12187d3b75d1671a4dd824b83aea3daa3722d3d42f7bd2da1c

Observation 159196e4-15a3-445b-8128-5546509fbc5b · outbound

This paper cites Crowdsourcing Multiple Choice Science Questions.

Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models Crowdsourcing Multiple Choice Science Questions

Reference 20

Resolution
metadata mismatch
local_arxiv, observed 2026-07-01T09:05:36.078054Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-07-11T11:50:26.030339Z digest=sha256:6a09d95a9e90bf2d56cbee677fd28c3da7d31b7303e7186cba04ab1d12c2e2b4

Observation 8b9a5a34-e44b-4324-8e57-810aed9be3f7 · outbound

This paper cites URL https://aclanthology.org/2025.tacl-1.26/.

Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models URL https://aclanthology.org/2025.tacl-1.26/

Reference 21

Resolution
verified exact
doi, observed 2026-07-01T09:05:36.082120Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-07-01T08:57:27.245873Z digest=sha256:5f82bfe49e2010e3c48441debda93086a0e4c8d80be734055d1bb43d6677524c

Observation 82b7696e-e99c-44a9-8a67-12d18264f3a1 · outbound

This paper cites Cohen and Ruslan Salakhutdinov and Christopher D.

Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models Cohen and Ruslan Salakhutdinov and Christopher D

Reference 22

Resolution
metadata mismatch
doi, observed 2026-07-01T09:05:36.087085Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-07-01T08:57:27.245873Z digest=sha256:6141dff4b245c0b3fbb1504b3b32e7998fbfe1a330a069eb18755f2076ffe504

Observation f16bc3af-0571-4de1-b063-5b8c30dade67 · outbound

This paper cites Benchmarking.

Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models Benchmarking

Reference 23

Resolution
metadata mismatch
doi, observed 2026-07-01T09:05:36.095388Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-07-01T08:57:27.245873Z digest=sha256:ec450edc070a040bdcda26611ec380d1f7d05d69bae96bfaacb2c0e8a49dd8e7

Pith citing papers

No inbound Pith citation observations are available.