Pith. sign in

Paper Citation Record · LEDGER

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework

As of 21 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 2 inbound Pith citation observations for arXiv:2507.19219.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.19219 v2

Coverage vector

measured 49 of 49 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T18:01:55.836203Z

measured 51 of 51 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-20T06:33:59.587034+00:00

measured 2 of 2 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-05-12T05:41:33.026345Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-12T05:46:24.255634Z

Reference resolution

49 of 49 outbound references displayed

  • verified exact0
  • verified fuzzy7
  • unresolved42
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation de701f72-c710-4c19-aa79-1cdb149ba1a5 · outbound

This paper cites , " * write output.state after.block = add.period write newline.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework , " * write output.state after.block = add.period write newline

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-15T18:01:55.508876Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T18:01:55.508876Z digest=sha256:a73608eff42d2ee42bbcd1c69730495c63f9a7089fb7796f5412998db3ea2a9e

Observation ef661ef1-c1da-4461-bfe7-e42144758803 · outbound

This paper cites write newline.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework write newline

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-15T18:01:55.518400Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T18:01:55.518400Z digest=sha256:f5f92649188fc20e22ca4db27b24033af4d9b01771e128b06149bf6ca46c6644

Observation a23bedcb-7cda-496c-9e55-d50cec278a01 · outbound

This paper cites online" 'onlinestring :=.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework online" 'onlinestring :=

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-15T18:01:55.526142Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T18:01:55.526142Z digest=sha256:1c746d1541ab2f4630e19217179d98b95746e73ad790947d6f1a6c6278792f75

Observation 25c9e4e2-3691-4a75-bddf-066fb4661db1 · outbound

This paper cites write newline.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework write newline

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-15T18:01:55.533594Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T18:01:55.533594Z digest=sha256:3d7a9d65140086baf9f55c11db23bf7d8c1c0f22714cec92fb9ffb193919be81

Observation d3a171cd-56dd-4186-95aa-4a526f425728 · outbound

This paper cites Qwen2 Technical Report.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework Qwen2 Technical Report

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T18:01:56.851023Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=arxiv_source observed=2026-08-15T18:01:55.541887Z digest=sha256:907da12340103fa845d6384bb6cb1ca45abbca4037edb2dd8dbb2bca18db8899

Observation d1b9016e-2025-468d-aa54-c3a51a77b0aa · outbound

This paper cites G.; and Chapelle, C.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework G.; and Chapelle, C

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T18:01:56.828269Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=arxiv_source observed=2026-08-15T18:01:55.552138Z digest=sha256:1e860c9a7e852411d021631ee7ee3431648116ac8e796a2330000b3cb4909805

Observation bf7bd0dc-f3de-4581-8a44-4ccb29f39f76 · outbound

This paper cites an unresolved cited work.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework Unresolved cited work

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-15T18:01:55.559260Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T18:01:55.559260Z digest=sha256:4a1b09a28afd28f9fb292307224f82cacc0fb5ba26b736f77ef7c644105a36bd

Observation 20545eb8-2c45-488e-88b6-b1014d396d38 · outbound

This paper cites an unresolved cited work.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework Unresolved cited work

Reference 8

Resolution
unresolved
raw_fallback, observed 2026-08-15T18:01:56.793642Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=arxiv_source observed=2026-08-15T18:01:55.566010Z digest=sha256:c6cb7d4eacdd513513d58694edfb5b58b6b0a85d32f1b29bf20ef90f32468874

Observation 1a6acc29-5978-4d64-a9fa-a3e88cf3e8f3 · outbound

This paper cites an unresolved cited work.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework Unresolved cited work

Reference 9

Resolution
unresolved
raw_fallback, observed 2026-08-15T18:01:56.772998Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=arxiv_source observed=2026-08-15T18:01:55.573762Z digest=sha256:6bc312618ac0190409e2f14c0f32a89bbb0c3518672df7751b91885b6e28837d

Observation 909831b6-c8c3-4b24-bc45-54b8228231d0 · outbound

This paper cites an unresolved cited work.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework Unresolved cited work

Reference 10

Resolution
unresolved
raw_fallback, observed 2026-08-15T18:01:56.754109Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=arxiv_source observed=2026-08-15T18:01:55.582581Z digest=sha256:40bd20ba084be9c132ea01dca09d7c3a60073307ee80a32fad158a87bb75b852

Observation a6f395b1-a8f4-467d-9e14-e60b4c8dceab · outbound

This paper cites N.; Li, T.; Li, D.; Zhu, B.; Zhang, H.; Jordan, M.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework N.; Li, T.; Li, D.; Zhu, B.; Zhang, H.; Jordan, M

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T18:01:56.734151Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=arxiv_source observed=2026-08-15T18:01:55.592757Z digest=sha256:52235aa68ff704aefdd9cfd1326782955f20bfca8004ac71f4adfde8fdb8e7a2

Observation 975ef086-0d2f-4479-be7e-f50b7669ff4f · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework Training Verifiers to Solve Math Word Problems

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-15T18:01:55.602383Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T18:01:55.602383Z digest=sha256:7807729671922f43bb123ae36c5ecbf600761a5a806d743934d541a02cdd45be

Observation c2580364-1796-4722-9084-5472b51f73ac · outbound

This paper cites an unresolved cited work.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework Unresolved cited work

Reference 13

Resolution
unresolved
raw_fallback, observed 2026-08-15T18:01:56.714746Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=arxiv_source observed=2026-08-15T18:01:55.608638Z digest=sha256:0b9168f065f4d6488547961ad60eeeb619bf0d3ed0a88027cf46564fe0696b0a

Observation 38f91d24-a655-4e12-bc39-52964c09dd74 · outbound

This paper cites an unresolved cited work.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework Unresolved cited work

Reference 14

Resolution
unresolved
raw_fallback, observed 2026-08-15T18:01:56.694654Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=arxiv_source observed=2026-08-15T18:01:55.614316Z digest=sha256:51f549734521752073b10b92d300d7566a65e9a6c7fb106b42041be4f59be85b

Observation 5c996d1c-ca6c-4adf-b9bd-3b7c14346336 · outbound

This paper cites an unresolved cited work.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework Unresolved cited work

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-15T18:01:55.619561Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T18:01:55.619561Z digest=sha256:69c08f7963b7f4063db822d4499603b5b2c47b565d3bb6631443ca0aa875fbf0

Observation 197b8bb9-3113-42e5-838b-060263718a05 · outbound

This paper cites Textbooks Are All You Need.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework Textbooks Are All You Need

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-15T18:01:55.624898Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T18:01:55.624898Z digest=sha256:249d9d9ad9a5215fdc50f4681aae3da35aa78382dfd28d88c64ccb5f20fe7f7e

Observation adee98e0-fa9c-4f64-952b-435a2bd005f3 · outbound

This paper cites an unresolved cited work.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework Unresolved cited work

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-15T18:01:55.630645Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T18:01:55.630645Z digest=sha256:5154cb3733a6806715da0046d916a4f655ed6d4021be46949560e690a79c9fd2

Observation 64af435e-867f-448a-94c5-e241839bdff4 · outbound

This paper cites OlympicArena: Benchmarking Multi-discipline Cognitive Reasoning for Superintelligent AI.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework OlympicArena: Benchmarking Multi-discipline Cognitive Reasoning for Superintelligent AI

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-15T18:01:55.636266Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T18:01:55.636266Z digest=sha256:dd18769fadfb61e57df33c9618c8d9162cd0c31a8ed1dd7583c09fd507569d1a

Observation d6005ea8-7433-46bc-bc2d-d750f52730c1 · outbound

This paper cites an unresolved cited work.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework Unresolved cited work

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-15T18:01:55.642060Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T18:01:55.642060Z digest=sha256:edbad30f645f3404600a7a505854133e0260b47edfe87c606893e9c8ddeefb4d

Observation f8adae2e-d0ec-4b1d-9a8d-fc7ace04c78c · outbound

This paper cites Investigating Data Contamination for Pre-training Language Models.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework Investigating Data Contamination for Pre-training Language Models

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-15T18:01:55.648414Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T18:01:55.648414Z digest=sha256:73e8498d4983f7d490c737878d2d92ea65930149bd42c35e7de5c73b7bc60c41

Observation 9793d50a-88dd-449c-9dcc-7cda7679c799 · outbound

This paper cites E.; Yang, J.; Wettig, A.; Yao, S.; Pei, K.; Press, O.; and Narasimhan, K.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework E.; Yang, J.; Wettig, A.; Yao, S.; Pei, K.; Press, O.; and Narasimhan, K

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T18:01:56.631862Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=arxiv_source observed=2026-08-15T18:01:55.654260Z digest=sha256:ef748cc5b1e2620ba8c7377e558ea19971895e7f8d24892a86f997cd8fbf23ff

Observation 75c7a7a7-ee09-46b9-993b-f3fd2f476ff1 · outbound

This paper cites From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-15T18:01:55.662468Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T18:01:55.662468Z digest=sha256:0358ecc90d1c1e361d0b9326a42ac134bb8f0c41346fdc99cdf813e004467b1c

Observation 32f46696-e39d-45a0-8542-9ef7e0fbd0fb · outbound

This paper cites E.; and Stoica, I.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework E.; and Stoica, I

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T18:01:56.610206Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=arxiv_source observed=2026-08-15T18:01:55.668498Z digest=sha256:036960ab4730729e34a5113cc4de34c6f55933ca9459f2c93302233869be22fd

Observation 1bab9562-35e8-488f-ab1a-41570e4bb1c3 · outbound

This paper cites Textbooks Are All You Need II: phi-1.5 technical report.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework Textbooks Are All You Need II: phi-1.5 technical report

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-15T18:01:55.674430Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T18:01:55.674430Z digest=sha256:1a26955af2d94e7c05e0f2230b9c12fd258d853f729ba1b35b49663aa31e379f

Observation 50b439a7-defb-4651-8ee1-477d7e163daa · outbound

This paper cites an unresolved cited work.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework Unresolved cited work

Reference 25

Resolution
unresolved
raw_fallback, observed 2026-08-15T18:01:56.591048Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=arxiv_source observed=2026-08-15T18:01:55.681134Z digest=sha256:ef7def452e9c9360630f12c3b8abc52eb61f2cdc103a2d84032025564b850184

Observation 0ba9996c-c450-4e83-8b35-e85b6cf4e6e7 · outbound

This paper cites an unresolved cited work.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework Unresolved cited work

Reference 26

Resolution
unresolved
raw_fallback, observed 2026-08-15T18:01:56.573262Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=arxiv_source observed=2026-08-15T18:01:55.686898Z digest=sha256:0c9b255b8b6803cd29b764892b6208ac1cbf7242d3d2a3e239368ce3c86c1168

Observation 9a1eb895-66d7-4f7d-b13a-e5a0135f118f · outbound

This paper cites Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-15T18:01:55.693029Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T18:01:55.693029Z digest=sha256:a3feb4706992bcef075a9078587066aed6676a912cd68eaa1a1dc4cfb91e3a7e

Observation 8de1b18e-c067-44e0-9b9e-8c0f82b02c4b · outbound

This paper cites an unresolved cited work.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework Unresolved cited work

Reference 28

Resolution
unresolved
raw_fallback, observed 2026-08-15T18:01:56.551689Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=arxiv_source observed=2026-08-15T18:01:55.699070Z digest=sha256:a6bd96a1a2a07c6122a326bb633324c186f194146452a1ccef0380e903848981

Observation 10941fed-2f6d-4968-be0a-6c7fedbc8ae0 · outbound

This paper cites GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-15T18:01:55.704411Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T18:01:55.704411Z digest=sha256:3e362b3b9da9cc01f62e24d1be819d4d0307e2ac31a6245bd4448bd2888afbd9

Observation a6a548f3-fcfc-425b-a430-c3c840c0c252 · outbound

This paper cites GPT-4 Technical Report.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework GPT-4 Technical Report

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-15T18:01:55.709827Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T18:01:55.709827Z digest=sha256:b3bd8bd955dc84f2d5486a145132f2695a4a204bf343b2d4162e21bb17ac5206

Observation 9f01e147-ff93-4e73-9c78-df41f77cf51c · outbound

This paper cites GPT-4o System Card.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework GPT-4o System Card

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-15T18:01:55.715343Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T18:01:55.715343Z digest=sha256:31a51282307090db60d7ef905f8afd892661267ad9e53013365b7ca80be6efa0

Observation cb003761-1184-4789-b462-f56a05221eea · outbound

This paper cites an unresolved cited work.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework Unresolved cited work

Reference 32

Resolution
unresolved
raw_fallback, observed 2026-08-15T18:01:56.532668Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=arxiv_source observed=2026-08-15T18:01:55.721411Z digest=sha256:13971ebcdcad7019d53e227bf8745ebc463bee0378445af5866625992f592a62

Observation 4204b1cb-f08f-4bb8-933d-288413222b3d · outbound

This paper cites an unresolved cited work.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework Unresolved cited work

Reference 33

Resolution
unresolved
raw_fallback, observed 2026-08-15T18:01:56.513939Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=arxiv_source observed=2026-08-15T18:01:55.726781Z digest=sha256:be19fb5d308e81e5d1c3fa20af5d476a5850f0605211a6e88d3141619965b8c4

Observation 886fe9bf-27e8-4f60-b7e1-4ce63b4081be · outbound

This paper cites an unresolved cited work.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework Unresolved cited work

Reference 34

Resolution
unresolved
raw_fallback, observed 2026-08-15T18:01:56.495555Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=arxiv_source observed=2026-08-15T18:01:55.732456Z digest=sha256:70f56e2bc21487f6103f8a6d8b320b49fdb0a2452909ec476ac596b00f743782

Observation df5bf444-4711-4382-9608-1659f3dfa045 · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-15T18:01:55.738519Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T18:01:55.738519Z digest=sha256:7b14027071413f66eff097afb7d16ebb4a9dab1d9b4d32e7b1d95326d75340d1

Observation 1461311b-bddd-401c-a678-87a7554ef371 · outbound

This paper cites an unresolved cited work.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework Unresolved cited work

Reference 36

Resolution
unresolved
raw_fallback, observed 2026-08-15T18:01:56.473936Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=arxiv_source observed=2026-08-15T18:01:55.744656Z digest=sha256:1c11477339bd3c0734c1abff6a1db4125cacd2d90d448836682b4400746b14dd

Observation b0bb6115-a0dd-48cb-b99d-ab1f8521afe6 · outbound

This paper cites R.; Zhang, S.; Sun, Y.; and Wang, W.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework R.; Zhang, S.; Sun, Y.; and Wang, W

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T18:01:56.451035Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=arxiv_source observed=2026-08-15T18:01:55.750766Z digest=sha256:98f7b8815422f59a6227f34722809d7733457b5d7439a659bbca1124b78f23b1

Observation 6ab5017e-a309-42cc-8af4-4e8d3216c147 · outbound

This paper cites MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-15T18:01:55.758217Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T18:01:55.758217Z digest=sha256:433502fb7c948522e4a08248627f15c268012b9b877d72427ce478b0bdb977eb

Observation 3db0d18a-3759-437d-8980-54c6b335f7b5 · outbound

This paper cites HelpSteer2-Preference: Complementing Ratings with Preferences.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework HelpSteer2-Preference: Complementing Ratings with Preferences

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-15T18:01:55.764894Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T18:01:55.764894Z digest=sha256:9d0f8b3dcff66eb88a877ed66dea49e509fde389863d29520f6f0a41adcefcf9

Observation 5b274764-4af1-479b-8f8c-d41e653f5620 · outbound

This paper cites LiveBench: A Challenging, Contamination-Limited LLM Benchmark.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework LiveBench: A Challenging, Contamination-Limited LLM Benchmark

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-15T18:01:55.772078Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T18:01:55.772078Z digest=sha256:027d9dfbc11309189878e450a2f9f118d89ade80742806ee4a29b0bf3e1e45f0

Observation 28de5af8-b5f2-4ac0-9dc9-7265f8dac8ad · outbound

This paper cites an unresolved cited work.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework Unresolved cited work

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-15T18:01:55.779492Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T18:01:55.779492Z digest=sha256:ee83f525ff123457f32414838ac73ea51f713da13c8f7a126a4f0ac1ae363526

Observation 1d6b58b7-c008-4b48-8b5f-6e16d748d806 · outbound

This paper cites an unresolved cited work.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework Unresolved cited work

Reference 42

Resolution
unresolved
raw_fallback, observed 2026-08-15T18:01:56.428925Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=arxiv_source observed=2026-08-15T18:01:55.786651Z digest=sha256:836965cacffaf37a7a36612b7d5fc40b9726b1108239cdbca64471bc27ea1721

Observation 6f6084a4-9800-4ef4-aab1-8a4103bece7a · outbound

This paper cites Benchmark Data Contamination of Large Language Models: A Survey.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework Benchmark Data Contamination of Large Language Models: A Survey

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-15T18:01:55.792774Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T18:01:55.792774Z digest=sha256:3d00c4d318b7d48141ab3de410dcc085a61b26c3f981a0b6d1a18b268d0a1c11

Observation ea4ec8ab-bfca-45cd-acfa-51f14490acd4 · outbound

This paper cites Rethinking Benchmark and Contamination for Language Models with Rephrased Samples.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework Rethinking Benchmark and Contamination for Language Models with Rephrased Samples

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-15T18:01:55.799239Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T18:01:55.799239Z digest=sha256:c49eb2cb526c97ae6d8d0feed853c7889a31218f8e7f04c9c9c2c4f636e1ce85

Observation be476101-66eb-474d-bf41-3bee196f84c9 · outbound

This paper cites Physics of Language Models: Part 2.1, Grade-School Math and the Hidden Reasoning Process.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework Physics of Language Models: Part 2.1, Grade-School Math and the Hidden Reasoning Process

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-15T18:01:55.808143Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T18:01:55.808143Z digest=sha256:5d2ec2437e7b971cded4b109dc4663f36954aae42f489aeb134a5eaad57f5d41

Observation 2c8fd61c-cbd6-49f4-921d-6eccb7cdbad9 · outbound

This paper cites an unresolved cited work.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework Unresolved cited work

Reference 46

Resolution
unresolved
raw_fallback, observed 2026-08-15T18:01:56.409971Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=arxiv_source observed=2026-08-15T18:01:55.813918Z digest=sha256:05608c878f34fe789d9ee25cce2afa59498922b72de9b60d952bed405fdd62ad

Observation f1709b14-4be9-4403-b2fa-bcbd841b2cd5 · outbound

This paper cites an unresolved cited work.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework Unresolved cited work

Reference 47

Resolution
unresolved
raw_fallback, observed 2026-08-15T18:01:56.391357Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=arxiv_source observed=2026-08-15T18:01:55.820500Z digest=sha256:b382958d798d62b047d5989f2fa0b45d5fa79b5906b1e026dee85fe68155edef

Observation 91f5e9fc-20ee-4e8d-ac92-aef7568cd88e · outbound

This paper cites Z.; Yang, D.; and Xie, X.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework Z.; Yang, D.; and Xie, X

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T18:01:56.371048Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=arxiv_source observed=2026-08-15T18:01:55.827990Z digest=sha256:46b5d0dac4506a4393dac264818214aecb4d84b7940bc9877a2727cb2171b51c

Observation ac12e6b6-1d26-47f5-9171-0072111cbdab · outbound

This paper cites an unresolved cited work.

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework Unresolved cited work

Reference 49

Resolution
unresolved
raw_fallback, observed 2026-08-15T18:01:56.351817Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=arxiv_source observed=2026-08-15T18:01:55.836203Z digest=sha256:3787867cc447a00fc3503d433b3d2ed6f1bfcd54b9f08fe0e6b5644e73304d18

Pith citing papers

Observation ebece4ca-6d1a-44e5-a104-5cf02be18e75 · inbound

Measuring AI Reasoning: A Guide for Researchers cites this paper.

Measuring AI Reasoning: A Guide for Researchers How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework

Reference 89

Resolution
metadata mismatch
arxiv_id, observed 2026-05-26T02:03:01.207018Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=arxiv_source observed=2026-05-08T18:53:18.586923Z digest=sha256:5f670ac7e6974f36cece4b934d484eedbfdc0cb4a2c4423cb16a311a8584359b

Observation 6a1e66ce-ddef-4ac5-a4d7-52e11b478d8e · inbound

Likelihood scoring for continuations of mathematical text: a self-supervised benchmark with tests for shortcut vulnerabilities cites this paper.

Likelihood scoring for continuations of mathematical text: a self-supervised benchmark with tests for shortcut vulnerabilities How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework

Reference 19

Resolution
verified exact
arxiv_id, observed 2026-05-26T02:03:01.207018Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-05-12T05:41:33.026345Z digest=sha256:93b25fe660d000ec3c5e2efa7fc11d895101c685bfce9b4c2ea78ac0f7e20fa6