Pith. sign in

Paper Citation Record · LEDGER

Language Model Tokenizers Introduce Unfairness Between Languages

As of 20 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 13 inbound Pith citation observations for arXiv:2305.15425.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2305.15425 v2

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 13 of 13 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-20T06:33:59.587034+00:00

measured 13 of 13 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-11T19:25:22.112975Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

29
arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation 8f3d0465-aa73-4646-aace-d3067162310b · inbound

When Every Token Counts: Optimal Segmentation for Low-Resource Language Models cites this paper.

When Every Token Counts: Optimal Segmentation for Low-Resource Language Models Language Model Tokenizers Introduce Unfairness Between Languages

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-11T19:25:22.112975Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T19:25:22.112975Z digest=sha256:959c33439539c47949823ebb727e5870e94684822d19fd5c78c9544544bc096e

Observation 5493db6b-1d07-41e4-a038-85a36e15f45b · inbound

Multilingual Question Answering in Low-Resource Settings: A Dzongkha-English Benchmark for Foundation Models cites this paper.

Multilingual Question Answering in Low-Resource Settings: A Dzongkha-English Benchmark for Foundation Models Language Model Tokenizers Introduce Unfairness Between Languages

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T14:32:25.383880Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:32:25.383880Z digest=sha256:8babae8fda683b64bd52d3ee4815a8ec642a5b8acb3a181745438e43c9996078

Observation 1121a55b-fb62-46b6-b0d0-c893765cad1f · inbound

Less, but Better: Efficient Multilingual Expansion for LLMs via Layer-wise Mixture-of-Experts cites this paper.

Less, but Better: Efficient Multilingual Expansion for LLMs via Layer-wise Mixture-of-Experts Language Model Tokenizers Introduce Unfairness Between Languages

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T13:12:00.875465Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T13:12:00.875465Z digest=sha256:d4bc2d159da80b6c9d9c862e5f7cc51092dd9e27b5187a69ae349c0c593c3939

Observation 2108986b-cfda-40b9-b2b3-3d827f213f76 · inbound

Causal Estimation of Tokenisation Bias cites this paper.

Causal Estimation of Tokenisation Bias Language Model Tokenizers Introduce Unfairness Between Languages

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T11:15:43.589887Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:15:43.589887Z digest=sha256:994c1add9398aa4486ab13702bf7847533db6db16aa221c1d71a6bebb4a34df5

Observation a4448f31-a4c7-4396-90ac-f0d963686242 · inbound

Script Sensitivity: Benchmarking Language Models on Unicode, Romanized and Mixed-Script Sinhala cites this paper.

Script Sensitivity: Benchmarking Language Models on Unicode, Romanized and Mixed-Script Sinhala Language Model Tokenizers Introduce Unfairness Between Languages

Reference 10

Resolution
verified exact
arxiv_id, observed 2026-05-16T12:37:53.013482Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-05-16T12:36:27.421985Z digest=sha256:462091fd2a2f335053301ec844142b2d1e08e3db034883c736d5c6a656b8a49b

Observation 487f9c6b-8106-4cad-9807-69ef24b82406 · inbound

ONTO: A Token-Efficient Columnar Notation for LLM Input Optimization cites this paper.

ONTO: A Token-Efficient Columnar Notation for LLM Input Optimization Language Model Tokenizers Introduce Unfairness Between Languages

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-05-10T09:23:37.781850Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=arxiv_source observed=2026-05-10T05:21:56.826488Z digest=sha256:23df2b25adbafadc8beeb3aa7b1689e84d5f70e6d4525ddf0e89b09538f2d42b

Observation f4f19e13-e5cb-451f-860c-91646d30f46c · inbound

Tokenizer Fertility and Zero-Shot Performance of Foundation Models on Ukrainian Legal Text: A Comparative Study cites this paper.

Tokenizer Fertility and Zero-Shot Performance of Foundation Models on Ukrainian Legal Text: A Comparative Study Language Model Tokenizers Introduce Unfairness Between Languages

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-05-20T21:09:02.558978Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=arxiv_source observed=2026-05-20T21:08:44.929762Z digest=sha256:2989e5c4b2b27f5868fd3dddb9b2a5a07440c65370725f86ca73c6419ea5ee43

Observation 54ff702d-6fd9-47d9-af6c-f107095d4e8e · inbound

LLMs in Qualitative Research: Opportunities, Limitations, and Practical Considerations cites this paper.

LLMs in Qualitative Research: Opportunities, Limitations, and Practical Considerations Language Model Tokenizers Introduce Unfairness Between Languages

Reference 53

Resolution
verified exact
arxiv_id, observed 2026-05-20T16:03:33.014552Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-05-20T15:59:56.231210Z digest=sha256:53893d8f1f69cd8f2ddff4da98d12bffad342abbb1c9e0877642a9a305dbd6f0

Observation fb7e9804-4133-4a84-a9e0-8ffa26f9554d · inbound

Tokenization with Split Trees cites this paper.

Tokenization with Split Trees Language Model Tokenizers Introduce Unfairness Between Languages

Reference 64

Resolution
verified exact
arxiv_id, observed 2026-05-22T05:51:08.838187Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=arxiv_source observed=2026-05-22T05:48:29.391178Z digest=sha256:fbd72a271433d5b6e1095e8eba736a77fb23777e7ebb63f2d3e66ced4b0c65d7

Observation 899c837d-d4cd-46af-94a5-8b9f213d26de · inbound

The Tokenizer Tax Across 25 European Languages: Domain Invariance, Cross-Lingual Few-Shot Effects, and the Ukrainian Penalty cites this paper.

The Tokenizer Tax Across 25 European Languages: Domain Invariance, Cross-Lingual Few-Shot Effects, and the Ukrainian Penalty Language Model Tokenizers Introduce Unfairness Between Languages

Reference 11

Resolution
metadata mismatch
arxiv_id, observed 2026-06-30T13:14:40.909415Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-06-30T13:08:33.172423Z digest=sha256:031bfb7b930d1c9e5edc07a74b24c6f28dcb43be323d21f0619fc03c2b43942c

Observation b2321e79-237a-41f1-a0db-c5d3bd003ee3 · inbound

BrahmicTokenizer-131K: An Indic-Capable Drop-In Replacement for o200k_base cites this paper.

BrahmicTokenizer-131K: An Indic-Capable Drop-In Replacement for o200k_base Language Model Tokenizers Introduce Unfairness Between Languages

Reference 24

Resolution
verified exact
arxiv_id, observed 2026-06-29T08:13:14.768133Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-06-29T08:12:16.235649Z digest=sha256:fb893605fc9041917688988160d9a758fa2c6dff13c5a4a3fc2687e3654fde89

Observation 69bdf272-e63f-4d5d-9a5d-062dab6f10de · inbound

Lower-Resource, Higher Scores: Language Bias in LLM Evaluators cites this paper.

Lower-Resource, Higher Scores: Language Bias in LLM Evaluators Language Model Tokenizers Introduce Unfairness Between Languages

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-02T02:01:38.447490Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T02:01:38.447490Z digest=sha256:985f7e598ef9952ebb995a01a691b9e048eee23677e0d82192bdae8d36bc8c4f

Observation 8afba8f7-16bf-4d88-83a8-5fab1838c950 · inbound

BHARATI: Morphology-Aware Tokenizers for Classical Indian Languages with Subword Fertility Analysis cites this paper.

BHARATI: Morphology-Aware Tokenizers for Classical Indian Languages with Subword Fertility Analysis Language Model Tokenizers Introduce Unfairness Between Languages

Reference 4

Resolution
unresolved
no resolver link, observed 2026-07-31T23:49:11.023254Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T23:49:11.023254Z digest=sha256:66eed26694d7056de88ab55df1bfff48c0be1b44a537e0bcdc9f432a4f58eafb