Pith. sign in

Paper Citation Record · LEDGER

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models

As of 17 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2506.15138.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.15138 v1

Coverage vector

measured 50 of 50 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T19:47:59.758998Z

measured 50 of 50 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-17T06:30:58.91139+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

50 of 50 outbound references displayed

  • verified exact3
  • verified fuzzy1
  • unresolved46
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 85669550-fee2-48d9-8eb3-2cd6c9637e2c · outbound

This paper cites GPT-4 Technical Report.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models GPT-4 Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-15T19:47:59.499219Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:47:59.499219Z digest=sha256:37954a1034b91ce3b57b74428fb425bb2c80efb288e4c21fef0fcf16e41b76b4

Observation 2789bf8d-326b-439d-90f7-2be9a4f7d70f · outbound

This paper cites an unresolved cited work.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models Unresolved cited work

Reference 2

Resolution
unresolved
raw_fallback, observed 2026-08-15T19:48:00.787349Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T19:47:59.505410Z digest=sha256:92b91de9b02c0fbc15a387ef66ab8aff99db877026b3ba48bc3baf5a5393f072

Observation bae2c230-d894-4273-8add-201038cd7414 · outbound

This paper cites Qwen Technical Report.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models Qwen Technical Report

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-15T19:47:59.510842Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:47:59.510842Z digest=sha256:aa2dc0767c5ffd385411d4a4a7e6c9ecf0a352dad527507502653a6cd934ee01

Observation 9e77dd50-a44c-48a7-b785-bd61375af239 · outbound

This paper cites Adaptive BPE Tokenization for Enhanced Vocabulary Adaptation in Finetuning Pretrained Language Models.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models Adaptive BPE Tokenization for Enhanced Vocabulary Adaptation in Finetuning Pretrained Language Models

Reference 4

Resolution
verified exact
local_arxiv, observed 2026-08-15T19:48:00.424811Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T19:47:59.516357Z digest=sha256:f7c161bafbfaf3b858c65ad5c0b9970e3e8297384472e6a16c8fc36a25954d97

Observation cffd4828-c8e9-46fe-b940-8aa8ad98e616 · outbound

This paper cites An Expanded Massive Multilingual Dataset for High-Performance Language Technologies (HPLT).

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models An Expanded Massive Multilingual Dataset for High-Performance Language Technologies (HPLT)

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-15T19:47:59.521940Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:47:59.521940Z digest=sha256:8cdc9599bce113a4b5124c52759e715952cc3ff2ba6401e05d1dd97d16890576

Observation 733101f7-8814-4f71-8912-486b9cbbf11c · outbound

This paper cites Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-15T19:47:59.528528Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:47:59.528528Z digest=sha256:e168bd8040f8839212fe87642201fa977dafd41e210139e43d68a27e15ca0016

Observation db4457e3-6252-4afe-9da5-762f96a9ae02 · outbound

This paper cites Getting the most out of your tokenizer for pre-training and domain adaptation.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models Getting the most out of your tokenizer for pre-training and domain adaptation

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-15T19:47:59.534351Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:47:59.534351Z digest=sha256:3e1df5c6d1040b748bdf5a909f61d078f49ed791cae43aeeedb58f188ef661f1

Observation 341c825e-1042-437d-a958-29bc7bbea7c7 · outbound

This paper cites an unresolved cited work.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models Unresolved cited work

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-15T19:47:59.539506Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:47:59.539506Z digest=sha256:5f7fe8d738c1b1fca611da20b8f877b3589c0ec05fbb1e1a294a7b82b527e6cf

Observation 0a21da18-f050-4a52-be61-65550e9a292c · outbound

This paper cites How do different tokenizers perform on downstream tasks in scriptio continua languages?: A case study in Japanese.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models How do different tokenizers perform on downstream tasks in scriptio continua languages?: A case study in Japanese

Reference 9

Resolution
verified exact
local_arxiv, observed 2026-08-15T19:48:00.353839Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T19:47:59.544491Z digest=sha256:29f4c453094880b86ebdf2e3544a386852f9c7c02b0e4c68eb14c04d97498afe

Observation 8f92c986-c3c4-4fba-9b24-99655f8dd1ba · outbound

This paper cites an unresolved cited work.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models Unresolved cited work

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-15T19:47:59.549720Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:47:59.549720Z digest=sha256:b53d745386451a24b12899ed8def2fac3ff4ccecccdcccdbb3b4ea815e4347ad

Observation 9e8ff8d0-00ac-4026-a0e4-52813f9448d7 · outbound

This paper cites Unpacking Tokenization: Evaluating Text Compression and its Correlation with Model Performance.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models Unpacking Tokenization: Evaluating Text Compression and its Correlation with Model Performance

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-15T19:47:59.554432Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:47:59.554432Z digest=sha256:00720bdc9471c92e2fe8e2b15da0d57340a2bf7705ba267f24465d58e1dc5e8d

Observation 0f6d8bf5-a482-459c-8c63-882cf13e938a · outbound

This paper cites The Llama 3 Herd of Models.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models The Llama 3 Herd of Models

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-15T19:47:59.559384Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:47:59.559384Z digest=sha256:1220a08b1b115a30fdf1712ab29e1fdbc69b67f782c5c9b940257ede2230a445

Observation c4cec494-d386-4138-b3c1-2a5264af483b · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-15T19:47:59.564377Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:47:59.564377Z digest=sha256:9ca3c125ae3fdc51013f21d42fa9320d4048cd68f22999a89642d68425cf9379

Observation f78465ae-67c3-4c52-ab8c-63d03f45f7c2 · outbound

This paper cites an unresolved cited work.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models Unresolved cited work

Reference 14

Resolution
unresolved
raw_fallback, observed 2026-08-15T19:48:00.744252Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T19:47:59.569320Z digest=sha256:c0d96cdbe3de8f586133972528d88b40ff73c89e40e17c32e91e2b4db263847b

Observation c3cf55d2-6958-439d-b7c5-068a4e2dd097 · outbound

This paper cites an unresolved cited work.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models Unresolved cited work

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-15T19:47:59.574424Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:47:59.574424Z digest=sha256:2c53b22f8eee97395099f41e36aa24d96dc059a4a5377790084a27efe6c98922

Observation 73793c27-5a6b-456f-a8ca-52424b03b142 · outbound

This paper cites an unresolved cited work.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models Unresolved cited work

Reference 16

Resolution
unresolved
raw_fallback, observed 2026-08-15T19:48:00.714519Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T19:47:59.579652Z digest=sha256:738b63eea230be495a33abdfeb94ccdb6cd98a1538056bde4b74e2381b39bde8

Observation b62926b5-3e24-4dae-9b53-455cb89f8c62 · outbound

This paper cites What Changes Can Large-scale Language Models Bring? Intensive Study on HyperCLOVA: Billions-scale Korean Generative Pretrained Transformers.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models What Changes Can Large-scale Language Models Bring? Intensive Study on HyperCLOVA: Billions-scale Korean Generative Pretrained Transformers

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-15T19:47:59.585032Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:47:59.585032Z digest=sha256:3a450503c0074501a065bd37668001a12f8c99a142110dcfa494baedfafd3c9f

Observation b80bdba0-f3f6-4d44-b8a4-2ddea4b65272 · outbound

This paper cites Subword Regularization: Improving Neural Network Translation Models with Multiple Subword Candidates.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models Subword Regularization: Improving Neural Network Translation Models with Multiple Subword Candidates

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-15T19:47:59.590138Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:47:59.590138Z digest=sha256:be2b71cf5ecd43ca7a00e6e144e54acf0c6bb2aa1e46850910d4466b46be19cf

Observation 13b715a8-d174-4b1e-b7c2-defd639c9e5a · outbound

This paper cites SentencePiece: A simple and language independent subword tokenizer and detokenizer for Neural Text Processing.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models SentencePiece: A simple and language independent subword tokenizer and detokenizer for Neural Text Processing

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-15T19:47:59.595322Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:47:59.595322Z digest=sha256:d80a544d0bd4d78fa841f96a9e04277f06b80db64387dec95d8cb6938200637e

Observation 4f2780a0-6ce0-46ae-96f3-b5a5fc9d8b95 · outbound

This paper cites an unresolved cited work.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models Unresolved cited work

Reference 20

Resolution
unresolved
raw_fallback, observed 2026-08-15T19:48:00.698482Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T19:47:59.600434Z digest=sha256:d935b0d2186ae8e6d791b0c587020b5287eefbb23ecb9cabe9cfe29f13c8d906

Observation 270361d5-5b98-4203-8fac-23144bed1b1a · outbound

This paper cites an unresolved cited work.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models Unresolved cited work

Reference 21

Resolution
unresolved
raw_fallback, observed 2026-08-15T19:48:00.682379Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T19:47:59.605729Z digest=sha256:0234b6cd76a13043122118ced73d5eebbb5b3f0072d40ed213a659a44cd2d7ac

Observation 2dc0644f-1ccb-4f32-8429-fc5979070045 · outbound

This paper cites an unresolved cited work.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models Unresolved cited work

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-15T19:47:59.610890Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:47:59.610890Z digest=sha256:02d84abce408de896407601a5f7847fba15a1fc02dda1dd2ca3d3289071b826c

Observation 98c41c12-dbd7-420c-9dae-edc9b3992592 · outbound

This paper cites DeepSeek-V3 Technical Report.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models DeepSeek-V3 Technical Report

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-15T19:47:59.617025Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:47:59.617025Z digest=sha256:d6e91132bf9e88a0ee97bd40b7c02ce470162439085d33854d13c2a7c3dc0a50

Observation 62e473fe-81fb-4462-af56-a8d1079d6426 · outbound

This paper cites SGDR: Stochastic Gradient Descent with Warm Restarts.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models SGDR: Stochastic Gradient Descent with Warm Restarts

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-15T19:47:59.622788Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:47:59.622788Z digest=sha256:d7afc44bb728afa2b6f446d5aa194a259c5e9f5b7a5072d5673a6758e3d49821

Observation 7b87be74-0718-49c4-857b-bfd937bc2e48 · outbound

This paper cites Decoupled Weight Decay Regularization.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models Decoupled Weight Decay Regularization

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-15T19:47:59.628541Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:47:59.628541Z digest=sha256:fe4838f4ceb8cc9641cc65aec598f43da2a59a636b7a102c5aa8d375502336b4

Observation fcd4ba1f-f441-4d7b-8a81-415fab548fc0 · outbound

This paper cites Meta Platforms.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models Meta Platforms

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T19:48:00.656084Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T19:47:59.633677Z digest=sha256:854d3dd723e22db9b6e016d254b11354d3ca7c0001283033cb60ad8e5ed1ed97

Observation 30f439af-c322-42e0-8f82-ad13eecbb48f · outbound

This paper cites Between words and characters: A Brief History of Open-Vocabulary Modeling and Tokenization in NLP.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models Between words and characters: A Brief History of Open-Vocabulary Modeling and Tokenization in NLP

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-15T19:47:59.638067Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:47:59.638067Z digest=sha256:2883e7c777a5683b8c6976a405ba183eeb50af0bd89244dc7dbb3d62b1904148

Observation 66be9740-471d-4b4d-8591-69fb407bb3b4 · outbound

This paper cites An Empirical Study of Tokenization Strategies for Various Korean NLP Tasks.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models An Empirical Study of Tokenization Strategies for Various Korean NLP Tasks

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-15T19:47:59.643267Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:47:59.643267Z digest=sha256:c1a48b29d40199a7a8da34d28dcdcd23970cce3407417f155f44ca1d678d567d

Observation 3c7ce041-7597-47e7-9c25-1d27e7db5d9d · outbound

This paper cites an unresolved cited work.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models Unresolved cited work

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-15T19:47:59.649040Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:47:59.649040Z digest=sha256:1a795f730c4616a0d963c9f6123a6bdaaa0e7d48e6e70537619b0f189b6c77b9

Observation 12210d51-8fdc-475c-9b85-d63debcaca45 · outbound

This paper cites BPE-Dropout: Simple and Effective Subword Regularization.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models BPE-Dropout: Simple and Effective Subword Regularization

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-15T19:47:59.656812Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:47:59.656812Z digest=sha256:1d4e93f583a2b4c5b87e684bcb12e42a26cd942bac85741f341853b0e484939a

Observation 9e3d8d42-3a1e-4430-a935-f97cf2bc891e · outbound

This paper cites Zero Bubble Pipeline Parallelism.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models Zero Bubble Pipeline Parallelism

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-15T19:47:59.661858Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:47:59.661858Z digest=sha256:cc6b8012aaaf8b09bd4578dccb572aa4b16adb6373deb4587e11e15b26735d08

Observation b095c7b8-2a11-43a3-8012-bdd2f98125ce · outbound

This paper cites an unresolved cited work.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models Unresolved cited work

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-15T19:47:59.667109Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:47:59.667109Z digest=sha256:8f5295917f1085f2a0afd27cbbe7e265ee7f18db2c37f915a412d459c206cdcf

Observation ede2af3e-0a26-4c52-aa60-30649f6edb19 · outbound

This paper cites an unresolved cited work.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models Unresolved cited work

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-15T19:47:59.672144Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:47:59.672144Z digest=sha256:1d2ffc3d46df57cca31673684a0f1a6dfd3c9ec02e4b876b110f5dc90d750c5a

Observation b0920566-f3ef-480d-874d-79fc57e6e13e · outbound

This paper cites an unresolved cited work.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models Unresolved cited work

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-15T19:47:59.677496Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:47:59.677496Z digest=sha256:d5295b39f62d6b2c026f78725bd7e6775ac62e2b2d0fc90b54dc9981d2db7418

Observation c48cd711-45f0-4228-95ad-5fb375a59087 · outbound

This paper cites How Good is Your Tokenizer? On the Monolingual Performance of Multilingual Language Models.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models How Good is Your Tokenizer? On the Monolingual Performance of Multilingual Language Models

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-15T19:47:59.682281Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:47:59.682281Z digest=sha256:8b3fb9cca0cd15000a4d2a39140a650cf3f64d27e077c65aeb6ca1604d5e4c20

Observation a844923e-b48f-4ee3-af77-939855f6b295 · outbound

This paper cites Tokenization Is More Than Compression.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models Tokenization Is More Than Compression

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-15T19:47:59.687743Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:47:59.687743Z digest=sha256:b9693611df447128c3b0c2556761cc118e52dbb6818934446ac4c70c44821ec3

Observation 663b83ba-8f9e-448f-974b-c2b492946fe7 · outbound

This paper cites an unresolved cited work.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models Unresolved cited work

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-15T19:47:59.692744Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:47:59.692744Z digest=sha256:72c98cae167bef8d6c6600b8259cd67891e85e72fc6438c94692291d0c718099

Observation 5b6daecf-4ce1-44eb-874a-b68605080614 · outbound

This paper cites Neural Machine Translation of Rare Words with Subword Units.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models Neural Machine Translation of Rare Words with Subword Units

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-15T19:47:59.697464Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:47:59.697464Z digest=sha256:35cb6d55b03f11f7133eb8937d7dff24c072b943477d4828c403e0affa301055

Observation 28a55d12-84f1-42a4-a04f-6251fa34c5d1 · outbound

This paper cites an unresolved cited work.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models Unresolved cited work

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-15T19:47:59.702982Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:47:59.702982Z digest=sha256:0f8eda009ae2b31c001d219ca73801ff3517e12c81673cb70b3067ae60d29780

Observation a06282b0-b9af-4278-8eae-5bbe90737881 · outbound

This paper cites GraphBPE: Molecular Graphs Meet Byte-Pair Encoding.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models GraphBPE: Molecular Graphs Meet Byte-Pair Encoding

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-15T19:47:59.708390Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:47:59.708390Z digest=sha256:ad692e2c36dd7ec2e3eb7dc20560ef0ce6947e6de592cea6f14c1cc4118a922f

Observation ede9fb37-7323-40da-ad93-437a2ae4f719 · outbound

This paper cites Gemma 2: Improving Open Language Models at a Practical Size.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models Gemma 2: Improving Open Language Models at a Practical Size

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-15T19:47:59.713821Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:47:59.713821Z digest=sha256:9e2abde99996c6a7a56fe1804a575607b6ead807a67d279d3556315f9be7235a

Observation 2c2ff89f-1880-4dc8-9817-8bdced36407b · outbound

This paper cites an unresolved cited work.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models Unresolved cited work

Reference 42

Resolution
unresolved
raw_fallback, observed 2026-08-15T19:48:00.576646Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T19:47:59.719506Z digest=sha256:21f0decd4e90fc41e015bc5a9535d763b96f34d1d8f6cb605d535e97da6b71ae

Observation b7e52288-1eb2-47fa-8dd0-165a107a50c5 · outbound

This paper cites an unresolved cited work.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models Unresolved cited work

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-15T19:47:59.724409Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:47:59.724409Z digest=sha256:bd813c6ff1d65b05a6f6dbbaa1edfa6b291159cc81e4e6351ef469f4d9770311

Observation c729b015-b5da-4362-854c-f21b28201505 · outbound

This paper cites an unresolved cited work.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models Unresolved cited work

Reference 44

Resolution
unresolved
raw_fallback, observed 2026-08-15T19:48:00.542767Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T19:47:59.729082Z digest=sha256:82876b83b0318023f71b535130f19f1cb31df525806f18c964ecc401fe59a3a1

Observation ca33ab7b-9023-43de-9866-0836d7d2750a · outbound

This paper cites an unresolved cited work.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models Unresolved cited work

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-15T19:47:59.734578Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:47:59.734578Z digest=sha256:17185a757adb40ed3f3cea1a3241a7339867afe87d35adba925ee4eac3398fd5

Observation 62662ad5-5887-4af7-b6a9-c466c1c5c735 · outbound

This paper cites Incorporating Context into Subword Vocabularies.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models Incorporating Context into Subword Vocabularies

Reference 46

Resolution
verified exact
local_arxiv, observed 2026-08-15T19:47:59.830216Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T19:47:59.739214Z digest=sha256:50a44fff78337d1ff00a1663a0d28e0a61d18f5854cb26387e4ad79b68c2fc42

Observation 61c4df7f-8b48-41f6-8eb7-1eee03035ef1 · outbound

This paper cites HellaSwag: Can a Machine Really Finish Your Sentence?.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models HellaSwag: Can a Machine Really Finish Your Sentence?

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-15T19:47:59.744094Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:47:59.744094Z digest=sha256:640c14792b257385b1f7ac785b875ede287601ba1f3b2dca185d5fa0eab7ed35

Observation 97e3abbc-fa98-4126-a164-b72201ff0742 · outbound

This paper cites an unresolved cited work.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models Unresolved cited work

Reference 48

Resolution
unresolved
raw_fallback, observed 2026-08-15T19:48:00.508061Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T19:47:59.749059Z digest=sha256:c627c0d0ae2d4094d47fb3056e83ef896a0a7b0ae658c17c15a1b3f8da41b376

Observation 4c745d4c-f867-4088-8ba9-09f34a09e274 · outbound

This paper cites URL: " 'urlintro :=.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models URL: " 'urlintro :=

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-15T19:47:59.753544Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:47:59.753544Z digest=sha256:5f5345d37b42dd6692365879c845e67d7bfd100f057ac0ae1894594765558fef

Observation a331d249-8366-463f-a9a3-1fa6767d7d33 · outbound

This paper cites write newline.

Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models write newline

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-15T19:47:59.758998Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:47:59.758998Z digest=sha256:7a797e50c37f4d877f7edb1243ddffbe3b567a3271d03bc0a6d5c437802fc1d5

Pith citing papers

No inbound Pith citation observations are available.