Pith. sign in

Paper Citation Record · LEDGER

VarBench: Robust Language Model Benchmarking Through Dynamic Variable Perturbation

As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 6 inbound Pith citation observations for arXiv:2406.17681.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2406.17681 v2

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 6 of 6 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 6 of 6 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T14:44:34.527611Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

1
arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation e3a6b919-8448-4ca2-b844-46c804bc44b4 · inbound

CapBencher: Give Your LLM Benchmark a Built-in Alarm for Test-Set Overfitting cites this paper.

CapBencher: Give Your LLM Benchmark a Built-in Alarm for Test-Set Overfitting VarBench: Robust Language Model Benchmarking Through Dynamic Variable Perturbation

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T14:44:34.527611Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:44:34.527611Z digest=sha256:8e3e66e1d270292630c4e13b750550f2814e2afade94cd396e7883832aa303c1

Observation f3eca25f-0978-4c78-996a-cf6f2e0748a7 · inbound

SciDA: Scientific Dynamic Assessor of LLMs cites this paper.

SciDA: Scientific Dynamic Assessor of LLMs VarBench: Robust Language Model Benchmarking Through Dynamic Variable Perturbation

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:18.482624Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:18.482624Z digest=sha256:6bb681de337c55ebd2a41833dbfd220643f8b4f45093a71d61a649936451fdb5

Observation 8e6a57ae-b729-439c-ad64-453e059d7b46 · inbound

Investigating Advanced Reasoning of Large Language Models via Black-Box Environment Interaction cites this paper.

Investigating Advanced Reasoning of Large Language Models via Black-Box Environment Interaction VarBench: Robust Language Model Benchmarking Through Dynamic Variable Perturbation

Reference 4

Resolution
verified exact
arxiv_id, observed 2026-05-18T21:36:51.921349Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-18T21:35:59.043898Z digest=sha256:58edc768d0ee12ebdaacbcdc573d5475c55909143b74c64107adecf5d532c7f8

Observation 75bd40fc-d788-4a65-a650-05bc3d64cba2 · inbound

Interactive Evaluation Requires a Design Science cites this paper.

Interactive Evaluation Requires a Design Science VarBench: Robust Language Model Benchmarking Through Dynamic Variable Perturbation

Reference 44

Resolution
verified exact
arxiv_id, observed 2026-05-20T10:58:14.009023Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-20T10:55:08.135630Z digest=sha256:c08ac02b5234e692bb186f57ea876c898a44f3d2ceb8be6d5b00db1f64e30d2c

Observation 1705460c-872b-494b-9257-08bef7e78f9b · inbound

Pretraining Data Exposure in Large Language Models: A Survey of Membership Inference, Data Contamination, and Security Implications cites this paper.

Pretraining Data Exposure in Large Language Models: A Survey of Membership Inference, Data Contamination, and Security Implications VarBench: Robust Language Model Benchmarking Through Dynamic Variable Perturbation

Reference 44

Resolution
metadata mismatch
arxiv_id, observed 2026-06-30T17:24:56.549713Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-06-30T17:20:16.735285Z digest=sha256:61a966005d5393530953b201a6b5ca3d10847d3bf3ac806c29d1b6bf3f6a137b

Observation ffb8bc5c-5013-4dfe-8042-d9db16fc59fd · inbound

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation cites this paper.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation VarBench: Robust Language Model Benchmarking Through Dynamic Variable Perturbation

Reference 28

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.950950Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.950950Z digest=sha256:322d83ec8872e07d7a5934182de9725e635c226bc44072b889aced6956f51ed5