Pith. sign in

Paper Citation Record · LEDGER

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling

As of 9 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2508.15190.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2508.15190 v1

Coverage vector

measured 35 of 35 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-05T18:07:41.620884Z

measured 35 of 35 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

35 of 35 outbound references displayed

  • verified exact5
  • verified fuzzy1
  • unresolved29
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation bc6b2515-b39d-43e6-ae51-6e33c688dbf4 · outbound

This paper cites URL: " 'urlintro :=.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling URL: " 'urlintro :=

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:37.702547Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:37.702547Z digest=sha256:ad3e0447b3f892bc86217467809a4caddca66b28172481aef2cf6b5dae6862a5

Observation c2ee23a1-dd8d-4e1a-930e-098a85da92d6 · outbound

This paper cites write newline.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling write newline

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:37.818997Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:37.818997Z digest=sha256:9397e22689b3c6d0f8b16f1f1224fe042beafe7070b79ca830056a646a4e04a4

Observation 17a9bd0e-08d7-4897-9f50-39f7bd9a0ed8 · outbound

This paper cites write newline.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling write newline

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:37.989006Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:37.989006Z digest=sha256:d18562b773c1b10f4133fd1fd7b9a68ff47dd5282f6a1cb3fb79e8371c116580

Observation cae37ac2-9563-4ddf-8242-04849e1be2f6 · outbound

This paper cites LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:38.087352Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:38.087352Z digest=sha256:7583d4dc2e18fda88a602ea45b7782ead3bd7af26d321275c161db9b3754bc68

Observation d63e078c-a1b5-4155-b924-cf874720bb9b · outbound

This paper cites Longformer: The Long-Document Transformer.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Longformer: The Long-Document Transformer

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:38.172306Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:38.172306Z digest=sha256:d5cacb594c9d838bbaac6402244103c1abb510889f3d58b08d2c2bbc173af087

Observation ba37e8dd-908c-49b5-80b4-1145ef7ce8ee · outbound

This paper cites Rethinking Attention with Performers.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Rethinking Attention with Performers

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:38.304671Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:38.304671Z digest=sha256:8dd200f37aaa43a09e517dc7f38b346f0221c75e1812488075aa9a791d3adebf

Observation a5eba188-0cd9-498c-a42f-1855bc88e910 · outbound

This paper cites an unresolved cited work.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Unresolved cited work

Reference 7

Resolution
unresolved
raw_fallback, observed 2026-08-05T18:07:43.920401Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-05T18:07:38.421542Z digest=sha256:a8bb6ec2ea29f691201eea22442d7d6854e3780729ae1ed89bd547e761473303

Observation 9457f708-cd6d-4f19-9497-710ad78f8529 · outbound

This paper cites FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:38.547812Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:38.547812Z digest=sha256:da0aafd7cac18b58883beca42a1289e1fe5491d59103757b08599f4f181d1380

Observation 85ada825-88a6-496d-b8f1-1a9fce6c9643 · outbound

This paper cites VIOLET : End-to-End Video-Language Transformers with Masked Visual-token Modeling.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling VIOLET : End-to-End Video-Language Transformers with Masked Visual-token Modeling

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:38.649205Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:38.649205Z digest=sha256:51acb3a80fa481e443031691bb235853b941e1e284213161ae559524fe8fde4a

Observation 211541c3-9676-404d-a13d-6b8e034b8658 · outbound

This paper cites Learned Token Pruning for Transformers.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Learned Token Pruning for Transformers

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:38.793573Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:38.793573Z digest=sha256:1c70ca3ef8b21185f5d4e2f3bda3d682542422e9dcede0679727b46772223de5

Observation 633dd6e5-4628-4dc7-bcaa-536ef4cc85fc · outbound

This paper cites BookSum: A Collection of Datasets for Long-form Narrative Summarization.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling BookSum: A Collection of Datasets for Long-form Narrative Summarization

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:38.945155Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:38.945155Z digest=sha256:e2afff1bfbb59135b191532f8449f6e835e3e124d0e6d730c2e6655bd6dd25f2

Observation b5f858e3-f0c2-4f86-b749-1a863314f112 · outbound

This paper cites Subword Regularization: Improving Neural Network Translation Models with Multiple Subword Candidates.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Subword Regularization: Improving Neural Network Translation Models with Multiple Subword Candidates

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:39.022747Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:39.022747Z digest=sha256:ccdae2cfd7a0755617fd9948b5adafadde89d80404e975afbb62827c8265578b

Observation 8dfbe177-8eae-498f-a04b-eceb46252b89 · outbound

This paper cites https://openreview.net/pdf?id=dMdxHd0tRf Quickmerge++: Token merging with autoregressive prior.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling https://openreview.net/pdf?id=dMdxHd0tRf Quickmerge++: Token merging with autoregressive prior

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T18:07:43.761348Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-05T18:07:39.092834Z digest=sha256:e9b55cf77f2ea5dc170494b171f42d45c28f05ca1196fe8c08b9700b27702e19

Observation 3b9abf43-6eea-466c-9ef6-ad8a45aa48de · outbound

This paper cites an unresolved cited work.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Unresolved cited work

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:39.177536Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:39.177536Z digest=sha256:6e26d55e58459abe95b40d20576b596cb4670b8737b34482c8ba6967a63760c1

Observation 41153489-9e05-4651-9026-bd74d5bd1e68 · outbound

This paper cites an unresolved cited work.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Unresolved cited work

Reference 15

Resolution
unresolved
raw_fallback, observed 2026-08-05T18:07:43.620220Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-05T18:07:39.228050Z digest=sha256:35e50711e747bb270db2a817011be260c3226d5f85b4aab95bd66c53a5e2c14d

Observation 47b2d7a1-683e-4c20-bbb3-14cf45a646df · outbound

This paper cites an unresolved cited work.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Unresolved cited work

Reference 16

Resolution
unresolved
raw_fallback, observed 2026-08-05T18:07:43.472315Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-05T18:07:39.312620Z digest=sha256:754a792881b2f1bbbdc3a18dae3f4dd1075883c4dd0a4381fc8b29e6e5c9dae3

Observation 6137810e-75b5-4683-aae1-2d1c0367ea6a · outbound

This paper cites an unresolved cited work.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Unresolved cited work

Reference 17

Resolution
unresolved
raw_fallback, observed 2026-08-05T18:07:43.279772Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-05T18:07:39.414089Z digest=sha256:5ff4a7749f7a25629ccd88c068d9b8081a9bf2b7391c732ddd216329b366b2eb

Observation 25f22337-0668-46b0-ac68-ce0c46574b32 · outbound

This paper cites Designing Large Foundation Models for Efficient Training and Inference: A Survey.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Designing Large Foundation Models for Efficient Training and Inference: A Survey

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:39.465068Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:39.465068Z digest=sha256:f14d77dc0cc4c8695f3ce61e968e6c41a6351880978d1edaf0820a7ccc895877

Observation a1e4f6fd-6f74-4c7b-a216-3e02a848e7c5 · outbound

This paper cites an unresolved cited work.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Unresolved cited work

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:39.562301Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:39.562301Z digest=sha256:14d90206c6d5c3e28e85ae7b0a20e613d0e29e2176d2648a46786f118f1a2256

Observation 914e7f33-327e-477c-ad22-87460706b8f3 · outbound

This paper cites Neural Machine Translation with Supervised Attention.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Neural Machine Translation with Supervised Attention

Reference 20

Resolution
verified exact
local_arxiv, observed 2026-08-05T18:07:42.713806Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-05T18:07:39.657701Z digest=sha256:a9ba733e02921484534fdb35d8f0909d141db94b567a808d5d1c419c0c4f0dcb

Observation f9a8f315-4927-4ae4-a80d-cc0bbc8bad66 · outbound

This paper cites an unresolved cited work.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Unresolved cited work

Reference 21

Resolution
unresolved
raw_fallback, observed 2026-08-05T18:07:43.148584Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-05T18:07:39.788284Z digest=sha256:4033d6df507f6baa11ee4006161998e9c0d152355d8ab052972dd3b94a4830db

Observation ef6da243-5754-45dc-8108-8302b450bd7d · outbound

This paper cites World Models with Hints of Large Language Models for Goal Achieving.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling World Models with Hints of Large Language Models for Goal Achieving

Reference 22

Resolution
verified exact
local_arxiv, observed 2026-08-05T18:07:42.561711Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-05T18:07:39.860495Z digest=sha256:32eb67fd88210b408f610625e809d3689081a776615f9d1564b62e9cbef67192

Observation 72a97c64-3a18-42af-a6a4-58988929efcc · outbound

This paper cites ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:39.947367Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:39.947367Z digest=sha256:889eecc99ce05e467ef925b7d983edfe7d706e661c5677419d9e7031a7a939b2

Observation 6227270c-a6fe-4f36-a384-70365be32d0a · outbound

This paper cites YaRN: Efficient Context Window Extension of Large Language Models.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling YaRN: Efficient Context Window Extension of Large Language Models

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:39.994180Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:39.994180Z digest=sha256:f47b4f747d8d92da7c84d90d028570801a6d0e23d3e8a56d0f894a7577e6e9e3

Observation adb9c764-4364-469c-80c3-c8b0d9920fde · outbound

This paper cites Compressive Transformers for Long-Range Sequence Modelling.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Compressive Transformers for Long-Range Sequence Modelling

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:40.090807Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:40.090807Z digest=sha256:2da1585e86fa6f10285bbfd10c829268018783cc8549b3ce10fc5f1fae5409ce

Observation 068104a3-15f0-473a-b2bc-307fa8026d00 · outbound

This paper cites Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:40.170338Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:40.170338Z digest=sha256:a30ae69d4807d7e8ba48080fe474b1d93df70f082a43c4a216d1835be32024eb

Observation b70de1e4-31e7-4325-9763-547d31e2aca4 · outbound

This paper cites Vision Transformers with Mixed-Resolution Tokenization.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Vision Transformers with Mixed-Resolution Tokenization

Reference 27

Resolution
verified exact
local_arxiv, observed 2026-08-05T18:07:42.339253Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-05T18:07:40.279621Z digest=sha256:fed237202112667ac5727cd29b7742d1a45eece52c508481a2639057ece8b73b

Observation aaccd53e-7f9f-48b2-89c8-5ef44f339107 · outbound

This paper cites an unresolved cited work.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Unresolved cited work

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:40.641184Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:40.641184Z digest=sha256:1b8f4db0ae55324d3f65b67825816350ef55ceec5db7b273149a3b622d3a0be9

Observation 0b7f72e8-50da-4880-8c67-cf34321f7a87 · outbound

This paper cites an unresolved cited work.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Unresolved cited work

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:40.769200Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:40.769200Z digest=sha256:d32b068adf293f515cba15ab687964cabaf97cc351f7ab4a8e7247c64a5bb81c

Observation 2e501358-530b-4f59-9587-505e06c45fdd · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling LLaMA: Open and Efficient Foundation Language Models

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:40.934995Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:40.934995Z digest=sha256:8af32d5711349b480150074100836093760ff007f8686892b1b76abc8ee64413

Observation e0246169-7889-49bb-9dbf-ac7b22468975 · outbound

This paper cites Focused Transformer: Contrastive Training for Context Scaling.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Focused Transformer: Contrastive Training for Context Scaling

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:41.031022Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:41.031022Z digest=sha256:8b3d403c68def814d12dfffe5c2b45458b04ba8ef3ca91df98e69c4537383041

Observation e6095f0d-720c-45aa-977f-91d4e2df6d41 · outbound

This paper cites Google's Neural Machine Translation System: Bridging the Gap between Human and Machine Translation.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Google's Neural Machine Translation System: Bridging the Gap between Human and Machine Translation

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:41.102041Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:41.102041Z digest=sha256:e3ab59b1bd0c142b56249913353512047d31d5627a6e410128073eb6befffeea

Observation 46facd0f-7b7f-4d97-b492-cc068625d9c3 · outbound

This paper cites Discourse-Aware Neural Extractive Text Summarization.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling Discourse-Aware Neural Extractive Text Summarization

Reference 34

Resolution
verified exact
local_arxiv, observed 2026-08-05T18:07:42.147315Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-05T18:07:41.270987Z digest=sha256:1de720525804c87e4d0cc8ba792bf750267b8e524c7b0ed18019408d6c359e5a

Observation aee5a756-cf6e-4a66-947d-ce91c80f51df · outbound

This paper cites TR-BERT: Dynamic Token Reduction for Accelerating BERT Inference.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling TR-BERT: Dynamic Token Reduction for Accelerating BERT Inference

Reference 35

Resolution
verified exact
local_arxiv, observed 2026-08-05T18:07:41.928491Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-05T18:07:41.473560Z digest=sha256:6d51e7e1f1aff7286e3c6a117baaa2e4e62a91ee836b6003e23d3ff88a94ea04

Observation a10cb385-0e8f-4ad3-a298-d0579c54ee75 · outbound

This paper cites H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models.

SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-05T18:07:41.620884Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:07:41.620884Z digest=sha256:c9d67cf05a7cf2c154a9d4ab2d8e504460cc6c0b0e2abdb672f48a5c38b25192

Pith citing papers

No inbound Pith citation observations are available.