Pith. sign in

Paper Citation Record · LEDGER

Style Over Substance: Evaluation Biases for Large Language Models

As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 10 inbound Pith citation observations for arXiv:2307.03025.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2307.03025 v3

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 10 of 10 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 10 of 10 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T14:19:18.862174Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-16T18:44:49.756684Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation 979eb0c7-d7ae-4ed5-96e6-747c2ef24814 · inbound

Lessons from the Trenches on Reproducible Evaluation of Language Models cites this paper.

Lessons from the Trenches on Reproducible Evaluation of Language Models Style Over Substance: Evaluation Biases for Large Language Models

Reference 87

Resolution
verified exact
arxiv_id, observed 2026-05-16T18:44:49.758379Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-05-16T18:44:49.519995Z digest=sha256:d49d27f3cb46c222026c216eeb1b5486b86badad29eb7a1244a2882e2f24e6b5

Observation e428d63a-d37a-465e-a4d8-978807aefe61 · inbound

Justice or Prejudice? Quantifying Biases in LLM-as-a-Judge cites this paper.

Justice or Prejudice? Quantifying Biases in LLM-as-a-Judge Style Over Substance: Evaluation Biases for Large Language Models

Reference 1

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T20:00:24.675263Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T20:00:24.651351Z digest=sha256:4382107c74d0ecc27521a12c7b7dfdfbb64ba3161f9ad8acf621c99dc24b4560

Observation 3b0b9ea3-5cbf-4690-9ad7-bc2719816663 · inbound

Simple and Effective Baselines for Code Summarisation Evaluation cites this paper.

Simple and Effective Baselines for Code Summarisation Evaluation Style Over Substance: Evaluation Biases for Large Language Models

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-07T14:19:18.862174Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:19:18.862174Z digest=sha256:7f0d15184f47623d69ce912f8dfc99e767051b04699b72f9c764a91dc25bf3ea

Observation a0f77b89-09ea-410d-b8ea-7fcf46ffa3bc · inbound

Towards Efficient and Effective Alignment of Large Language Models cites this paper.

Towards Efficient and Effective Alignment of Large Language Models Style Over Substance: Evaluation Biases for Large Language Models

Reference 190

Resolution
unresolved
no resolver link, observed 2026-08-07T04:55:43.107652Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:55:43.107652Z digest=sha256:585dd7c4e99eadeead68f99ff2a10f906d7e2983814fbb92d51ee388d27cfdd9

Observation f8c77f3b-3746-4371-abd6-e3bb2c761ef8 · inbound

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities cites this paper.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Style Over Substance: Evaluation Biases for Large Language Models

Reference 1992

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.242829Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.242829Z digest=sha256:1204197293045f4bdc00024f391a14c1bc350c06c256f7820488e646120db68c

Observation 5b2b1bf0-7fb1-4fc5-a63d-3b1c6b8b978f · inbound

Who Endorsed It? Measuring Authority Bias Across Expertise Levels in Language Models cites this paper.

Who Endorsed It? Measuring Authority Bias Across Expertise Levels in Language Models Style Over Substance: Evaluation Biases for Large Language Models

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-03T09:37:09.585094Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T09:37:09.585094Z digest=sha256:7de8b39911f07715b3dc4f7adafd41e3b1cb0f92ce6fc5fef51098031bf2c73c

Observation 4271f0a9-1cf1-433c-a4c1-24d5bd6fe217 · inbound

IatroBench: Pre-Registered Evidence of Iatrogenic Harm from AI Safety Measures cites this paper.

IatroBench: Pre-Registered Evidence of Iatrogenic Harm from AI Safety Measures Style Over Substance: Evaluation Biases for Large Language Models

Reference 36

Resolution
verified exact
arxiv_id, observed 2026-05-11T00:35:52.649999Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-05-10T18:25:53.037936Z digest=sha256:1feee978a4c3c9ed7ef1c608b67a1f2cc4cdfd2dac7d4134a864970182b1eb3a

Observation 35faa975-e561-4925-9c3c-ab85a65e667d · inbound

IatroBench: Pre-Registered Evidence of Iatrogenic Harm from AI Safety Measures cites this paper.

IatroBench: Pre-Registered Evidence of Iatrogenic Harm from AI Safety Measures Style Over Substance: Evaluation Biases for Large Language Models

Reference 36

Resolution
unresolved
no resolver link, observed 2026-07-13T00:19:33.861692Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-07-13T00:19:33.861692Z digest=sha256:f7ec97f3d7874e38efd903810a759b46da669f5612701cc0e221e81d0efd6a8e

Observation 4b64db33-a99a-4bdc-bbed-472a9f4b3bce · inbound

Judging the Judges: A Systematic Evaluation of Bias Mitigation Strategies in LLM-as-a-Judge Pipelines cites this paper.

Judging the Judges: A Systematic Evaluation of Bias Mitigation Strategies in LLM-as-a-Judge Pipelines Style Over Substance: Evaluation Biases for Large Language Models

Reference 23

Resolution
verified exact
arxiv_id, observed 2026-05-11T20:41:14.156272Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-08T08:14:18.535385Z digest=sha256:530a6d91ca0bed68b7754a4e4c0eb8d4fd77281339072c8d0cc7e608ca1518a7

Observation a2eea7dd-311f-454c-946d-ebb8a963edd1 · inbound

PERSA: Reinforcement Learning for Professor-Style Personalized Feedback with LLMs cites this paper.

PERSA: Reinforcement Learning for Professor-Style Personalized Feedback with LLMs Style Over Substance: Evaluation Biases for Large Language Models

Reference 37

Resolution
verified exact
arxiv_id, observed 2026-05-11T15:51:42.468260Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-05-09T19:09:07.557773Z digest=sha256:ddee8539ba425ad34d89c9bd853dbece6a76f94ea5d5fd1c2151096b93de48cd