Pith. sign in

Paper Citation Record · LEDGER

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling

As of 13 August 2026, this Paper Citation Record lists 100 of 122 outbound references and 20 inbound Pith citation observations for arXiv:2507.07955.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.07955 v2

Coverage vector

measured 100 of 122 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T18:34:03.437070Z

measured 120 of 120 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-13T06:32:02.005865+00:00

measured 20 of 20 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T23:13:07.268239Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-08-05T02:28:24.338817Z

Reference resolution

100 of 122 outbound references displayed

  • verified exact2
  • verified fuzzy17
  • unresolved80
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

0
pith, observed 2026-08-05T02:28:24.338817Z

Outbound references

Observation 707c6725-6344-4713-88e3-d4590d560da8 · outbound

This paper cites MAGNET: Improving the Multilingual Fairness of Language Models with Adaptive Gradient-based Tokenization.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling MAGNET: Improving the Multilingual Fairness of Language Models with Adaptive Gradient-based Tokenization

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:56.069034Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:56.069034Z digest=sha256:31839752117c30e617999de6415c8d9dc80833d0ff9ca28177d8f5d932e51e65

Observation 3e20b3f1-0a96-4e46-8f30-ce8d7e970e50 · outbound

This paper cites Do All Languages Cost the Same? Tokenization in the Era of Commercial Language Models.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Do All Languages Cost the Same? Tokenization in the Era of Commercial Language Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:56.148760Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:56.148760Z digest=sha256:3f74b796277555618a6f5094ab4e0e27a64d7089eb5797ef1eb44d4d41d83461

Observation 83b2d33c-3b63-42fe-9b3f-c4a116342364 · outbound

This paper cites Synthetic and Natural Noise Both Break Neural Machine Translation.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Synthetic and Natural Noise Both Break Neural Machine Translation

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:56.248506Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:56.248506Z digest=sha256:13a120265fe166ddab78ad1bd0a03aa6f6ac13bdcc3c95a00e8b9680efb5c7af

Observation ee3be644-deda-44dc-8e17-65dcf5c6c251 · outbound

This paper cites Longformer: The Long-Document Transformer.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Longformer: The Long-Document Transformer

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:56.352694Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:56.352694Z digest=sha256:0d117789a4bebafcd92508a25c125e8c356f54da252778b806a74394ff4e3c1e

Observation 8c9a3f8a-0b8a-4fd1-bed3-0a3df2f9a4f8 · outbound

This paper cites Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:56.442435Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:56.442435Z digest=sha256:a6f4e80a00b6c7cc6d7687f49f6370a17fb6c359b027d79d3b928bacc4dff6cf

Observation 29ee2793-2146-42c7-8333-d75017ec83d6 · outbound

This paper cites Transformers to SSMs: Distilling Quadratic Knowledge to Subquadratic Models.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Transformers to SSMs: Distilling Quadratic Knowledge to Subquadratic Models

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:56.525717Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:56.525717Z digest=sha256:6deb491320d569827f3fab8bdc9d712f675f4bb0d8015738af1041e9c0902693

Observation 4a07803f-87d8-4344-8d5c-6ceabafe270b · outbound

This paper cites PIQA: Reasoning About Physical Commonsense in Natural Language.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling PIQA: Reasoning About Physical Commonsense in Natural Language

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:56.613945Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:56.613945Z digest=sha256:eabfcea327d23e005faf8d104bee3bbb21bf7fd94beb86fd377c4961d0f3c59f

Observation 9f5dad53-8214-4c22-a289-ce1b4d2fc3c4 · outbound

This paper cites Token Merging: Your ViT But Faster.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Token Merging: Your ViT But Faster

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:56.720718Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:56.720718Z digest=sha256:3783b88a64bea96d9cc935ff30b22b87dff47e01a2edb31929da2ec1542077a6

Observation 91320439-9707-4f71-be92-1901582af275 · outbound

This paper cites Genome Modeling and Design Across All Domains of Life with Evo 2.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Genome Modeling and Design Across All Domains of Life with Evo 2

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:56.808022Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:56.808022Z digest=sha256:3bc846a63bce4df01c86760d606a5f2471be5ea47fb4be4143b109e2d20b7383

Observation 62a9fd53-1ee1-4d8d-b662-86d5d30220fd · outbound

This paper cites Language Models are Few-shot Learners.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Language Models are Few-shot Learners

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:56.914512Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:56.914512Z digest=sha256:991c2439eb31cf9d5be48cdb505e1cf3092f8f665c107654b8523194b7b3fe64

Observation 10be0abd-e827-478e-ac21-caf4354396cb · outbound

This paper cites Dilated Recurrent Neural Networks.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Dilated Recurrent Neural Networks

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:56.994395Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:56.994395Z digest=sha256:bd99c4ca27fd0dd63f9fec0470315b60171a910ff4473cbc487dd347ef857fb2

Observation 282b3504-9a1e-4928-9058-9427d4ae8d14 · outbound

This paper cites Accelerating Large Language Model Decoding with Speculative Sampling.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Accelerating Large Language Model Decoding with Speculative Sampling

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:57.127775Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:57.127775Z digest=sha256:86eb1bcc94eaa42ddaea84f51771dd2bf8bb2c154c845c21d0fd7be5fe9205fa

Observation b1a07763-f22a-4f5d-aa5e-4e82af5491f4 · outbound

This paper cites Don’t Look Twice: Faster Video Transformers with Run-Length Tokenization.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Don’t Look Twice: Faster Video Transformers with Run-Length Tokenization

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:57.218342Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:57.218342Z digest=sha256:06e74af00bf14dd0c7f90e358714b6c57ae76a258e74fad6b400c5ab0b7ff0a4

Observation 5e366462-5017-42b0-b9ff-777f9c496e53 · outbound

This paper cites Canine: Pre-training an Efficient Tokenization-free Encoder for Language Representation.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Canine: Pre-training an Efficient Tokenization-free Encoder for Language Representation

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:57.303728Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:57.303728Z digest=sha256:7f3d8c2729bc58d5ffc6d1dec8615b03ce7ab9a42d927361481458530ef609d3

Observation 07068e03-605d-48bc-b35d-8f060569a3ba · outbound

This paper cites Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:57.397934Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:57.397934Z digest=sha256:15787813b4113bb504dbab67125d71799cab0a4fa64e73e9198c8e2ab919090c

Observation b4c391f2-d1ac-4dd1-a7ba-8cbbc495801a · outbound

This paper cites Funnel-Transformer: Filtering out Sequential Redundancy for Efficient Language Processing.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Funnel-Transformer: Filtering out Sequential Redundancy for Efficient Language Processing

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:57.534134Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:57.534134Z digest=sha256:e9b3f69242cfef57cecf170a0cb78c13a43e417aca93b23779db173bb3fe611a

Observation a9e79734-0578-4005-b9a0-d47518933e11 · outbound

This paper cites FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:57.636340Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:57.636340Z digest=sha256:51495f0a67172f8dfdd69d4ecb3dbb9d8d43f3b02b657174d30cf1dcfabc5552

Observation fc08cb45-3213-4cd7-a104-462c7aef6871 · outbound

This paper cites Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:57.737504Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:57.737504Z digest=sha256:8875b46d6a95f69d6bbdd0cda53d90480cde16f6aded4d34a65473979f5cd554

Observation 96f036bf-24f4-4210-a8d5-f664d3d6c88d · outbound

This paper cites DeepSeek-V3 Technical Report.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling DeepSeek-V3 Technical Report

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:57.827233Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:57.827233Z digest=sha256:5cce091f84c3ad100552eaf2610dd4123957c8f2eee75259e1320e0182620b88

Observation 32a4080e-4585-41fb-8b0f-a248afbc0ea4 · outbound

This paper cites Variable-rate discrete representation learning.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Variable-rate discrete representation learning

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:57.894052Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:57.894052Z digest=sha256:edfb417226ac889667cbda4ba027e178eb7081acc6b4c04cf06f2a8f72c86978

Observation 2323c7ec-a7b3-44bc-ba15-3df2fdafb985 · outbound

This paper cites An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:57.985194Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:57.985194Z digest=sha256:8a630c778021fe217dd1eaf852f018bd614d43abe73c622809c6629f9479b764

Observation 61996061-ffb8-4299-8d57-7848f7353990 · outbound

This paper cites Adaptive Length Image Tokenization via Recurrent Allocation.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Adaptive Length Image Tokenization via Recurrent Allocation

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:58.123541Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:58.123541Z digest=sha256:e121b6e42edbc9952dc3140763c17e1b050eb9b977a67a5df7e696d7a96dbf28

Observation 94f5b8d8-af5e-4a8e-b024-65de585eac53 · outbound

This paper cites Multiscale Byte Language Models -- A Hierarchical Architecture for Causal Million-Length Sequence Modeling.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Multiscale Byte Language Models -- A Hierarchical Architecture for Causal Million-Length Sequence Modeling

Reference 23

Resolution
verified exact
local_arxiv, observed 2026-08-06T18:34:04.262427Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T18:33:58.172677Z digest=sha256:3c34d2cb7fda6e815cf956053db5fa9b014714e926871ef6fef08f120fabada5

Observation ea5bf5b5-3296-4184-9632-fcfcc6774d32 · outbound

This paper cites Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:58.236902Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:58.236902Z digest=sha256:0f99cfd3302535fbb180b926fca38fc9018b1b886b38d43391fb16af8584d063

Observation a25322da-6241-4cb6-b0f2-63623ecbf488 · outbound

This paper cites Toucan: Token-Aware Character Level Language Modeling.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Toucan: Token-Aware Character Level Language Modeling

Reference 25

Resolution
verified exact
local_arxiv, observed 2026-08-06T18:34:04.245652Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T18:33:58.300524Z digest=sha256:b3cc591cbd23c2718e494c2d27793b955f697fd758eba90d2f1be35fb244af09

Observation c82d2767-fc89-4f09-b1de-4ed0d8fe790b · outbound

This paper cites The Pile: An 800GB Dataset of Diverse Text for Language Modeling.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling The Pile: An 800GB Dataset of Diverse Text for Language Modeling

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:58.364801Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:58.364801Z digest=sha256:988c10976126ac8cf701399ceac49bb44b77d92222397d23d07b8908ac319850

Observation 0faeb429-e058-479d-a7ce-28195b37d55b · outbound

This paper cites The Language Model Evaluation Harness.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling The Language Model Evaluation Harness

Reference 27

Resolution
malformed identifier
no resolver link, observed 2026-08-06T18:33:58.424785Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:58.424785Z digest=sha256:46c80605efc2ea4250700dcbdc4d9c8f3d7fd00e49fdd40c02eeda083327306b

Observation 5082abf8-d89d-47e2-b239-b481bf1ab8d7 · outbound

This paper cites Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:58.488903Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:58.488903Z digest=sha256:bfab96beaed350e41981548de99f1f93d5c0211ad28c14c9498b8d5cdf44267e

Observation f140f5c2-9b26-41a2-bf7f-785c1919e8c1 · outbound

This paper cites MANTa: Efficient Gradient- Based Tokenization for End-to-End Robust Language Modeling.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling MANTa: Efficient Gradient- Based Tokenization for End-to-End Robust Language Modeling

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:58.548362Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:58.548362Z digest=sha256:91e32767d75e0836375ae182be076d98f0ae1ad15969af1b268e3622942d7e84

Observation 7763644f-8401-4baa-9ce9-c55bae0be62f · outbound

This paper cites It’s Raw! Audio Generation with State-Space Models.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling It’s Raw! Audio Generation with State-Space Models

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:58.621929Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:58.621929Z digest=sha256:757fa7404f57be83a1202da55e327440fa7b259d7a5fd8df1ec2264f20e09749

Observation 0606f69a-7175-4e76-bd43-dd12fa31f9a1 · outbound

This paper cites The Llama 3 Herd of Models.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling The Llama 3 Herd of Models

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:58.673703Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:58.673703Z digest=sha256:8b1ba5947e31b00c9789e99504c2e07859959e4918f1c848b147fcea3a7da131

Observation 0ce72938-074e-4ff1-820d-bd3bb097ed78 · outbound

This paper cites Modeling Sequences with Structured State Spaces.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Modeling Sequences with Structured State Spaces

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:58.728086Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:58.728086Z digest=sha256:db04a64a84ef97a991e9ffe799d88724a7ac2392143bd1afb9d2f1b3ff60211a

Observation 0ec14e83-de2b-4cbf-b2a9-dcc3c6e462c0 · outbound

This paper cites On the Tradeoffs of State Space Models and Transformers.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling On the Tradeoffs of State Space Models and Transformers

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:58.798006Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:58.798006Z digest=sha256:8a4d8eec5926f3a69b6c71e6248671495682cb11dcac615872c300ca7dfab43e

Observation 188bd421-de77-49cb-a2dd-8756d656af64 · outbound

This paper cites Mamba: Linear-Time Sequence Modeling with Selective State Spaces.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Mamba: Linear-Time Sequence Modeling with Selective State Spaces

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:58.861404Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:58.861404Z digest=sha256:a2907e90dd57657708a6f58b538b124c7622a8f0e13cb7fba64d745c7ae2f6be

Observation 8df56b5b-a90b-4f88-80de-826f28f202f6 · outbound

This paper cites Efficiently Modeling Long Sequences with Structured State Spaces.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Efficiently Modeling Long Sequences with Structured State Spaces

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:58.932243Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:58.932243Z digest=sha256:56b05f35ede19b8b1dff18a6480f15f081af6b41d0a6b39cc80e43f652e3d86c

Observation 2f9a1be9-6480-480d-8309-247c76078400 · outbound

This paper cites Log-Linear Attention.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Log-Linear Attention

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:58.990431Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:58.990431Z digest=sha256:33d3e349359a477cca6c854edf67f40aca389bc1fa06890bd5f1f7d6736cf049

Observation ddd4fb3f-4a89-4fae-956f-eeeac7e86d39 · outbound

This paper cites Scaling Laws and Compute- optimal Training Beyond Fixed Training Durations.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Scaling Laws and Compute- optimal Training Beyond Fixed Training Durations

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:59.055589Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:59.055589Z digest=sha256:82f99842ff6bf123e7d134e2440b09c646b247fdfee1633956762c1dd6716af9

Observation 8963a931-1215-4de5-9499-bdee0ba23b2d · outbound

This paper cites Training Large Language Models to Reason in a Continuous Latent Space.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Training Large Language Models to Reason in a Continuous Latent Space

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:59.115960Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:59.115960Z digest=sha256:47b14d9e7f2d6034f4af32a66deeb36ce330204f75b6e227d19d0be7d3f69588

Observation a0548bdf-0c17-4358-b78e-ec8c7f03db0d · outbound

This paper cites Data Mixture Inference Attack: BPE Tokenizers Reveal Training Data Compositions.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Data Mixture Inference Attack: BPE Tokenizers Reveal Training Data Compositions

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:59.173351Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:59.173351Z digest=sha256:a266f5d9f98b8d0c6ea302a6728c464b8a48b9bf04188b8af87f916001aece73

Observation af1a5679-b455-403d-8306-0ecfe6177f9b · outbound

This paper cites Deep residual learning for image recognition.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Deep residual learning for image recognition

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:59.235396Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:59.235396Z digest=sha256:d852b562a591252353820641cd7c1350f1c7bdf60b11df502181023bd22c1132

Observation 689483e8-c140-4d2c-9561-d2bbf72a6762 · outbound

This paper cites Block Transformer: Global-to-local Language Modeling for Fast Inference.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Block Transformer: Global-to-local Language Modeling for Fast Inference

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:59.302514Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:59.302514Z digest=sha256:375a0c260c0f446947e4598d31b2dbe614106818139b5c29eff04c53c1391060

Observation c978949e-743f-4cc7-b2e8-aa75ebae865b · outbound

This paper cites Training Compute-Optimal Large Language Models.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Training Compute-Optimal Large Language Models

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:59.356222Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:59.356222Z digest=sha256:311e084b7a14d3de885c4f70726ea4b03285bed7cc2bb1b4fe8ac98ff0589635

Observation 7460326c-062d-4d2b-a595-69d4ed9a738f · outbound

This paper cites MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:59.393544Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:59.393544Z digest=sha256:123afb46d451274bca75b515eba5abd99a0212a82e58eaec75577d5569a61acc

Observation a8406be4-22ff-4571-8b0c-3f0854251f13 · outbound

This paper cites Over-Tokenized Transformer: Vocabulary is Generally Worth Scaling.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Over-Tokenized Transformer: Vocabulary is Generally Worth Scaling

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:59.396344Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:59.396344Z digest=sha256:c171262068002967cd58c4160d96019bfcb76273e4263dc8c34c88b3edd3ec1c

Observation 0636fc25-2837-42bf-a493-1f01ffbe242e · outbound

This paper cites Simple and Scalable Strategies to Continually Pre-train Large Language Models.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Simple and Scalable Strategies to Continually Pre-train Large Language Models

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:59.479358Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:59.479358Z digest=sha256:ed99e530ca84b6224fffe7f2ed86e86604eb6ec9c5c846f573192d63be4cde5c

Observation e67d51d6-6a55-4f15-beaf-ec31daf93ffa · outbound

This paper cites Categorical Reparameterization with Gumbel-Softmax.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Categorical Reparameterization with Gumbel-Softmax

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:59.687663Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:59.687663Z digest=sha256:37c4c968a62df6e52496700ca7c360d27fb49e5c4792caed152663f66cd919ec

Observation 9ae3ec0a-4294-471e-999e-c31d90f76e51 · outbound

This paper cites Repeat After Me: Transformers are Better than State Space Models at Copying.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Repeat After Me: Transformers are Better than State Space Models at Copying

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:59.785532Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:59.785532Z digest=sha256:8a323fe42610579838c769e88fde6a3cd0f87b4bcdeae425acbdc38927d9c8b8

Observation 3e4d0250-d042-4740-8e03-eb9141ae8a79 · outbound

This paper cites MrT5: Dynamic Token Merging for Efficient Byte-level Language Models.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling MrT5: Dynamic Token Merging for Efficient Byte-level Language Models

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:59.863542Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:59.863542Z digest=sha256:07c8c427e64e417bd0886505f82985176f7863b71fb3fe3812efef7773572e74

Observation 0252c6dd-9a34-4253-9fb0-714c328c4f5c · outbound

This paper cites Scaling Laws for Neural Language Models.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Scaling Laws for Neural Language Models

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-06T18:33:59.969329Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:33:59.969329Z digest=sha256:f6c898a8bdb5a8e3b08a6e79f9cbf3c8679071c249966013bd498c474d8c5ade

Observation b06434ab-1537-4761-99d6-68d3506d46d9 · outbound

This paper cites Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-06T18:34:00.109902Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:34:00.109902Z digest=sha256:5f010f5bbeb0cbda43a93609d3b8d235b989eee2b5e247aeaad963a1134b48bf

Observation 6a014035-051b-41b5-8344-2d2a486c2418 · outbound

This paper cites A Clockwork RNN.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling A Clockwork RNN

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-06T18:34:00.241224Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:34:00.241224Z digest=sha256:ba408c4583d30a6e19f1c55d1ad316b0d928e7124af556ecd01a2db7bea23fa2

Observation 95a86f15-3415-42d8-b11e-41ac065cbe99 · outbound

This paper cites ImageNet Classification with Deep Convolutional Neural Networks.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling ImageNet Classification with Deep Convolutional Neural Networks

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-06T18:34:00.364696Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:34:00.364696Z digest=sha256:01e3a53a49b6c076c773f47b9afc767274d3f5568149dd58b427e92607baabbe

Observation c5633181-3908-4854-89f8-6903dc78fcf3 · outbound

This paper cites SentencePiece: A simple and language independent subword tokenizer and detokenizer for Neural Text Processing.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling SentencePiece: A simple and language independent subword tokenizer and detokenizer for Neural Text Processing

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-06T18:34:00.445000Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:34:00.445000Z digest=sha256:4bf7c92bcd679224aa2560d0e7d1102fc34b7426a0f8ad8cfc0045035d543e59

Observation b02f13da-1d69-48e2-9c80-fad83ca2bf58 · outbound

This paper cites From Digits to Decisions: How Tokenization Impacts Arithmetic in LLMs.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling From Digits to Decisions: How Tokenization Impacts Arithmetic in LLMs

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-06T18:34:00.556734Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:34:00.556734Z digest=sha256:ec55deb506dfdb2ebd7cc4778e1705bbaab062a968d4348d8874cd8740b120e4

Observation 46071184-7723-4fa7-a1e1-3f997333a229 · outbound

This paper cites Fast Inference from Transformers via Speculative Decoding.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Fast Inference from Transformers via Speculative Decoding

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-06T18:34:00.642539Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:34:00.642539Z digest=sha256:1de89f75fb2cfe87f63ba2f86ab4d06381a445a0de1959e6162003652ab92710

Observation 8f89d9cd-c5b7-40e6-9f7b-eb1c7eaa2ea3 · outbound

This paper cites Autoregressive Adversarial Post-Training for Real-Time Interactive Video Generation.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Autoregressive Adversarial Post-Training for Real-Time Interactive Video Generation

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-06T18:34:00.784649Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:34:00.784649Z digest=sha256:cdc4c9778bfb1c904c9efc9b96682ff285aa796623bf72849982daa544e75419

Observation f6782354-3162-4084-9c49-07ccb092254b · outbound

This paper cites SuperBPE: Space Travel for Language Models.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling SuperBPE: Space Travel for Language Models

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-06T18:34:00.904383Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:34:00.904383Z digest=sha256:152c9e3d7aceb5aad413c48ae4709e4eeb27d558f870a676c9be4561a78446b6

Observation 4ca83b9d-1575-44fa-b969-bdc14e7c3d1b · outbound

This paper cites Decoupled Weight Decay Regularization.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Decoupled Weight Decay Regularization

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-06T18:34:01.032619Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:34:01.032619Z digest=sha256:9aa9f9d7dbba30c2aca81942e8df643802104c969365d5733ec7eb33657136bc

Observation ae1f0fd3-d508-45fb-8464-7b7d473f9181 · outbound

This paper cites Structured State Space Models for In-context Reinforcement Learning.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Structured State Space Models for In-context Reinforcement Learning

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-06T18:34:01.146905Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:34:01.146905Z digest=sha256:be3a06584849d82df04daffc9e83929e9c63c75169452197cb8ee1af4a0c3979

Observation d23eada1-fdfc-43b6-b8f3-62a7c240d035 · outbound

This paper cites The Concrete Distribution: A Continuous Relaxation of Discrete Random Variables.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling The Concrete Distribution: A Continuous Relaxation of Discrete Random Variables

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-06T18:34:01.267229Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:34:01.267229Z digest=sha256:e0a0f349963364629087cbb71fa41b6328ba70ed3deb0ab5e477d8bd9be65465

Observation 645de534-b3c9-4001-b3fa-cb076b81198b · outbound

This paper cites On the SDEs and Scaling Rules for Adaptive Gradient Algorithms.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling On the SDEs and Scaling Rules for Adaptive Gradient Algorithms

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-06T18:34:01.377193Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:34:01.377193Z digest=sha256:5232e0401b7113567e9d48d23704c659d33d7b488247ab89c78c5c90de07fe97

Observation d52883c0-8ab6-4f41-aaa8-c4568d021b0c · outbound

This paper cites LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-06T18:34:01.502212Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:34:01.502212Z digest=sha256:5e51133e89b02e06203a8fab21f1158eb762241b6658a14023e01da150432609

Observation e06543a6-941d-4c2a-abdd-ab33c25f39ce · outbound

This paper cites Critical Batch Size Revisited: A Simple Empirical Approach to Large-Batch Language Model Training.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Critical Batch Size Revisited: A Simple Empirical Approach to Large-Batch Language Model Training

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-06T18:34:01.552977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:34:01.552977Z digest=sha256:5bd90bcb7028b7acadf253805c5d87ec719df3f9773c41499ad5192ff0fc5375

Observation d7df0829-a47d-4d16-a6f1-a2e938eb4c5c · outbound

This paper cites Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-06T18:34:01.648462Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:34:01.648462Z digest=sha256:5fcbcc836ae1701089683dd539d68ca2407d732da560dda1e43d2958b2a6954f

Observation 5d827db5-0d8b-4e6e-b79a-1d8ea4c3b9cb · outbound

This paper cites Zero-Shot Tokenizer Transfer.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Zero-Shot Tokenizer Transfer

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-06T18:34:01.732878Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:34:01.732878Z digest=sha256:3a1b027a41f67212634c7ab60deb3400bd746e89f33f1a6bc100f040c0ed1cc3

Observation 764d25c4-0409-41cb-b92d-c8391fa2c400 · outbound

This paper cites Universal Cross-Tokenizer Distillation via Approximate Likelihood Matching.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Universal Cross-Tokenizer Distillation via Approximate Likelihood Matching

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-06T18:34:01.818277Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:34:01.818277Z digest=sha256:d3ec82968d21dade3467f94cee7cfbd7831efcf27b8a9f2b739867a6e0130930

Observation da186991-6278-4831-927b-ab7048a73008 · outbound

This paper cites Crosslingual Generalization through 27 Multitask Finetuning.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Crosslingual Generalization through 27 Multitask Finetuning

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-06T18:34:01.858564Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:34:01.858564Z digest=sha256:7042563e24cb6dec6e4e3ed4d3299b228daa59a29fa67b48f06f2b52ed2a3489

Observation 03d96932-f9a4-430e-8d77-08fb15f705a0 · outbound

This paper cites s1: Simple test-time scaling.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling s1: Simple test-time scaling

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-06T18:34:01.952008Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:34:01.952008Z digest=sha256:da02e120cb95bdbdaf1715ab884ff94d1ca95b24d82a49555eaab6f364c467b3

Observation a1a80607-7892-49b2-9e44-df5fb21cdccd · outbound

This paper cites Efficient Transformers with Dynamic Token Pooling.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Efficient Transformers with Dynamic Token Pooling

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-06T18:34:02.045003Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:34:02.045003Z digest=sha256:3a749de1e8335af306cbda32099eb2b64b502f0c33d1ad221f7400bdb0f5f0cf

Observation 434310d7-9cd2-451a-bb13-1944f0bf85d5 · outbound

This paper cites Hierarchical Transformers Are More Efficient Language Models.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Hierarchical Transformers Are More Efficient Language Models

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-06T18:34:02.185925Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:34:02.185925Z digest=sha256:2a7133d4429dcdc84a445cfa4c63afda959dbf74259476c405b5e79ba3e7f936

Observation ecb503ee-ed2b-4f3e-ae74-e12c7f943463 · outbound

This paper cites Introducing OpenAI o1-preview.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Introducing OpenAI o1-preview

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-06T18:34:02.205975Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:34:02.205975Z digest=sha256:7aa075c77e1114ceb6efd36ea811e1d56d4ef9aafdc6b2a40b3bd9edb9a27318

Observation 8e67bcc0-2611-495d-9d96-e7291394e431 · outbound

This paper cites Byte Latent Transformer: Patches Scale Better Than Tokens.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Byte Latent Transformer: Patches Scale Better Than Tokens

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-06T18:34:02.209101Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:34:02.209101Z digest=sha256:35dc333bbba22fd1de6f6b0017e425c453c87c463c929231298bb91960ed5dcf

Observation df0d336c-b7b9-4338-a98e-418a51bf1cd9 · outbound

This paper cites The LAMBADA dataset: Word prediction requiring a broad discourse context.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling The LAMBADA dataset: Word prediction requiring a broad discourse context

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-06T18:34:02.316858Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:34:02.316858Z digest=sha256:9bf6e35f10fac4ced1682005953a500d206b761f2633d92168859a5bd9fb83e2

Observation 7b2f71fd-f2b2-4560-bc1b-f854b93f85f4 · outbound

This paper cites The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-06T18:34:02.394837Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:34:02.394837Z digest=sha256:8ab5f6d93b1c632ee961bfb59d4d0b8cb4cf8c6b9c481f9f152a7427d1ed1f44

Observation 2e44aa7a-9f9d-413a-8efe-823f53a769aa · outbound

This paper cites The Bitter Lesson is coming for Tokenization.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling The Bitter Lesson is coming for Tokenization

Reference 75

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:34:04.844929Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T18:34:02.487766Z digest=sha256:2a4857ebe6a8153419074ffd9db17e576aa80d1b7047da5f3812a433e1f4f4be

Observation 07e9a470-a82f-471d-b120-1778c4234278 · outbound

This paper cites Language Model Tokenizers Introduce Unfairness Between Languages.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Language Model Tokenizers Introduce Unfairness Between Languages

Reference 76

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:34:04.835466Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T18:34:02.563580Z digest=sha256:4ada023361fd26b1eb97a6584721ff4a779107bdc6e46520f4fbaeb0adc1d541

Observation ca052b0c-be44-41be-951a-6fc25ece7d45 · outbound

This paper cites Exact Byte-Level Probabilities from Tokenized Language Models for FIM-Tasks and Model Ensembles.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Exact Byte-Level Probabilities from Tokenized Language Models for FIM-Tasks and Model Ensembles

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-06T18:34:02.569149Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:34:02.569149Z digest=sha256:8712aa44378dfe2eae3e9140e18846adb368cd1155062bb666e44eea807ab5a3

Observation 26d26839-2663-45bc-80dc-42f2e3fb7fc8 · outbound

This paper cites Hyena Hierarchy: Towards Larger Convolutional Language Models.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Hyena Hierarchy: Towards Larger Convolutional Language Models

Reference 79

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:34:04.811174Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T18:34:02.583306Z digest=sha256:a6f6aa85598eaba0b23e085fa515883b7f92219c08bdcd0671037fecf1073398

Observation c47c4ead-945c-4b51-87bd-b8647d482249 · outbound

This paper cites Language Models are Unsupervised Multitask Learners.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Language Models are Unsupervised Multitask Learners

Reference 80

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:34:04.796734Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T18:34:02.665123Z digest=sha256:e8389d85a54d9fe70821fd7b54928231be4e13ec8e8a523d89777419686d6792

Observation f7f312ea-261d-4372-81e0-3ae1fc9c8d4a · outbound

This paper cites An Analysis of Tokenization: Transformers Under Markov Data.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling An Analysis of Tokenization: Transformers Under Markov Data

Reference 81

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:34:04.784507Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T18:34:02.759272Z digest=sha256:7000f0deff2c5b2b8a7170e4f2b93dcabf787929ade0c2150b657a6fe565d484

Observation 5f16c1be-30f6-460d-b9b6-a27452801c7a · outbound

This paper cites Mixture-of-Depths: Dynamically allocating compute in transformer-based language models.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Mixture-of-Depths: Dynamically allocating compute in transformer-based language models

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-06T18:34:02.828915Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:34:02.828915Z digest=sha256:e9065b67eba4f017b03d787861cf714be016851221fe26f71d99df3373535bf7

Observation 13288869-d75a-41a5-a60b-a3cdcff90b40 · outbound

This paper cites U-Net: Convolutional Networks for Biomedical Image Segmentation.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling U-Net: Convolutional Networks for Biomedical Image Segmentation

Reference 83

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:34:04.773342Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T18:34:02.884515Z digest=sha256:84fa3739a54cbde5dc671020197c82a09ab84868d368813c95854a1465b5cf49

Observation ecc96691-bb96-4e89-b50e-990b31027845 · outbound

This paper cites WinoGrande: An Adversarial Winograd Schema Challenge at Scale.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling WinoGrande: An Adversarial Winograd Schema Challenge at Scale

Reference 84

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:34:04.759690Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T18:34:02.927239Z digest=sha256:f929a8156355a7bcb07ffb4a02d5a6b00ee6af75ccc1844d9048bfdaf1a7184d

Observation 6efdc217-8389-487f-aaaf-3ff9bd4a1c35 · outbound

This paper cites Caduceus: Bi- directional Equivariant Long-Range DNA Sequence Modeling.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Caduceus: Bi- directional Equivariant Long-Range DNA Sequence Modeling

Reference 85

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:34:04.730706Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T18:34:03.001334Z digest=sha256:096984bba41029783c3ee437e41dbdfa34bcce2c02627fee051f9a405dc567e4

Observation 95bfa5fa-8eb0-43fe-8642-f330d7c01304 · outbound

This paper cites Tokenization Is More Than Compression.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Tokenization Is More Than Compression

Reference 86

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:34:04.699290Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T18:34:03.081340Z digest=sha256:b0f5627485d0d69f4c7374298337674596190c933e343b774d0cb468d7c59aa4

Observation eb383d93-85e3-4134-b398-c42b1ea6d052 · outbound

This paper cites Neural Machine Translation of Rare Words with Subword Units.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Neural Machine Translation of Rare Words with Subword Units

Reference 87

Resolution
unresolved
no resolver link, observed 2026-08-06T18:34:03.098703Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:34:03.098703Z digest=sha256:f4115012a28f73196fecfe398248076530fc902f47b6d8b78691faf6413fb39f

Observation e7d79ca5-a589-4ad3-9139-4d980e3666e5 · outbound

This paper cites Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer

Reference 88

Resolution
unresolved
no resolver link, observed 2026-08-06T18:34:03.210520Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:34:03.210520Z digest=sha256:604ae629fd62e1b0b8a6489bb2f1e88f081d5f344a68a8d89939ae7779280593

Observation d182f5ec-9cba-4ee5-9408-21f482208fe6 · outbound

This paper cites SpaceByte: Towards Deleting Tokenization from Large Language Modeling.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling SpaceByte: Towards Deleting Tokenization from Large Language Modeling

Reference 89

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:34:04.684400Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T18:34:03.288340Z digest=sha256:8fba6a58056cd5c2c72adee44f300271535a9ece175dfb159735d763254538c8

Observation 81ef6245-ade3-4da5-b76f-37829110e8f7 · outbound

This paper cites Local Byte Fusion for Neural Machine Translation.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Local Byte Fusion for Neural Machine Translation

Reference 90

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:34:04.655766Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T18:34:03.369256Z digest=sha256:40aab10d8d304879f88b784f5220e9419c2f978916e0b681dcc96a7ccb99aca9

Observation ae6f2142-4cd7-4a54-8945-18366df212ff · outbound

This paper cites Adv-BERT: BERT is not robust on misspellings! Generating nature adversarial samples on BERT.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Adv-BERT: BERT is not robust on misspellings! Generating nature adversarial samples on BERT

Reference 91

Resolution
unresolved
no resolver link, observed 2026-08-06T18:34:03.396926Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:34:03.396926Z digest=sha256:bb55491f5e0f5dd98f8a3b7d321222e5451308b52e93efea379e14a9ca2b7b26

Observation 6c522fc6-d195-41f0-a069-18937510a245 · outbound

This paper cites The Bitter Lesson.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling The Bitter Lesson

Reference 92

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:34:04.636231Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T18:34:03.413775Z digest=sha256:22a1844d12b2994be0398673a8cab65aabf19a04440cfda0ba39ec749cbd77e2

Observation dfc9d467-10a2-4736-abca-3696d3092229 · outbound

This paper cites Scaling Laws with Vocabulary: Larger Models Deserve Larger Vocabularies.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Scaling Laws with Vocabulary: Larger Models Deserve Larger Vocabularies

Reference 93

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:34:04.628677Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T18:34:03.416364Z digest=sha256:4893e3abd811bf83a39222fa8008dff90c37f89d177d14e4f649bddc5c7d468b

Observation 87a89f24-7de9-4067-8470-1f4da4f6750d · outbound

This paper cites Charformer: Fast Character Transformers via Gradient-based Subword Tokenization.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Charformer: Fast Character Transformers via Gradient-based Subword Tokenization

Reference 94

Resolution
unresolved
no resolver link, observed 2026-08-06T18:34:03.418750Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:34:03.418750Z digest=sha256:afd0349544c3bf19e709d8378741d9186073dc99ef05ebeb72efe36be9e90fd5

Observation 0b81fbfd-4f2d-40e8-8d7f-3ecafd591814 · outbound

This paper cites Learn Your Tokens: Word-Pooled Tokenization for Language Modeling.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Learn Your Tokens: Word-Pooled Tokenization for Language Modeling

Reference 95

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:34:04.611686Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T18:34:03.421475Z digest=sha256:6da32a18e9261fc69ddb81f525af799cd72c5d0d193bb551d28021a29db15dcd

Observation 754847c3-3beb-4a61-98e3-0d9ecd1f8aa6 · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling LLaMA: Open and Efficient Foundation Language Models

Reference 96

Resolution
unresolved
no resolver link, observed 2026-08-06T18:34:03.423892Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:34:03.423892Z digest=sha256:92a2b576843c5b7d295d001b43bf8287f28de8904a94afa907542642c9945d5c

Observation 35bb22f3-eaea-4704-b699-9acb5b24c711 · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 97

Resolution
unresolved
no resolver link, observed 2026-08-06T18:34:03.426630Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:34:03.426630Z digest=sha256:a9b586cfaa3be5ace167a4e16c4c1490875eb5c92fba30f235bec4ed7c9de674

Observation 142a6589-acd9-40d3-a80b-6e774ba17ddb · outbound

This paper cites Neural Discrete Representation Learning.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Neural Discrete Representation Learning

Reference 98

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:34:04.604339Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T18:34:03.429283Z digest=sha256:80ff29fd5d35b762e80431f58902e51514bd7b81c92da1bc5afee4c11f7fb562

Observation 0d49945e-125f-47e4-b509-adb85db59aa7 · outbound

This paper cites Attention is All You Need.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling Attention is All You Need

Reference 99

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:34:04.590025Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T18:34:03.431645Z digest=sha256:7a4eb5ae3ef8c47120f7f60a4f7c912fcfc15fdceb0c55ea8ded9e3f9f677b7b

Observation acb66ced-78d1-4170-8fd1-d82fe0b1d8db · outbound

This paper cites From Bytes to Ideas: Language Modeling with Autoregressive U-Nets.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling From Bytes to Ideas: Language Modeling with Autoregressive U-Nets

Reference 100

Resolution
unresolved
no resolver link, observed 2026-08-06T18:34:03.434422Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:34:03.434422Z digest=sha256:50f5dafbdf048fd219df929e10e67d7250dadd0795d002f3c89d9ec7cfee0d51

Observation 8c8d60ff-fcb6-4297-8df3-51b60604ccc8 · outbound

This paper cites From Language Models over Tokens to Language Models over Characters.

Dynamic Chunking for End-to-End Hierarchical Sequence Modeling From Language Models over Tokens to Language Models over Characters

Reference 101

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:34:04.581347Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T18:34:03.437070Z digest=sha256:b19dd8083805c9aa733f6c82da05565c0d7351e71b9e7edee487122444e49888

Pith citing papers

Observation 5e9d73fa-dc57-4337-abf8-ef5c8045dbe2 · inbound

Controllably Efficient Language Models cites this paper.

Controllably Efficient Language Models Dynamic Chunking for End-to-End Hierarchical Sequence Modeling

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-03T23:33:56.393190Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T23:33:56.393190Z digest=sha256:a2fdea4a7814121094d421a7e7b9eee485b1e6f7fdcc1deb11bbcf9dd56d435e

Observation 49fcb3f2-d1bc-4798-8921-dc7ac1e05bbf · inbound

Echoes Over Time: Unlocking Length Generalization in Video-to-Audio Generation Models cites this paper.

Echoes Over Time: Unlocking Length Generalization in Video-to-Audio Generation Models Dynamic Chunking for End-to-End Hierarchical Sequence Modeling

Reference 16

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T19:56:33.512371Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-15T19:53:18.200223Z digest=sha256:699db1eb94c1fe0deb150523aa1a07330ea6277ed00acf8fe2881dccbb6b317b

Observation 5899afe0-5110-4023-a469-40044df65f91 · inbound

DC-DiT: Adaptive Compute and Elastic Inference for Visual Generation via Dynamic Chunking cites this paper.

DC-DiT: Adaptive Compute and Elastic Inference for Visual Generation via Dynamic Chunking Dynamic Chunking for End-to-End Hierarchical Sequence Modeling

Reference 4

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T15:10:05.845619Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-15T15:10:00.146694Z digest=sha256:6f6e6005d46669dd2eecf4f2a748a9cbf50ead03b502afc05f7927c795f58389

Observation d9cafcc0-c48c-41db-a64a-994ca215c93f · inbound

Decoupling the Benefits of Subword Tokenization for Language Model Training via Byte-level Simulation cites this paper.

Decoupling the Benefits of Subword Tokenization for Language Model Training via Byte-level Simulation Dynamic Chunking for End-to-End Hierarchical Sequence Modeling

Reference 16

Resolution
metadata mismatch
arxiv_id, observed 2026-05-12T09:41:25.784360Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-07T10:05:24.009460Z digest=sha256:544e5de5eca5bb720ea8777d4e704d457aba01e2e6b97aaa01f5266e216250c4

Observation 74b88ba2-9ef0-42a5-b689-f285331c22d7 · inbound

Decoupling the Benefits of Subword Tokenization for Language Model Training via Byte-level Simulation cites this paper.

Decoupling the Benefits of Subword Tokenization for Language Model Training via Byte-level Simulation Dynamic Chunking for End-to-End Hierarchical Sequence Modeling

Reference 16

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T06:59:49.180626Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-15T06:58:22.362262Z digest=sha256:2d5425250e9bcc90b062c583b76c1103e7e9925cbb640c3461c9223b34c0043a

Observation f91640eb-0bdd-47e0-9e68-d53a6e209cff · inbound

Training Transformers for KV Cache Compressibility cites this paper.

Training Transformers for KV Cache Compressibility Dynamic Chunking for End-to-End Hierarchical Sequence Modeling

Reference 22

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T18:41:11.466350Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-08T14:20:34.452801Z digest=sha256:7335a6c5b979cf559985bd40fbeef32bd85585440d5cbdca54f2178c6f20ace6

Observation 68a00469-4c6f-486a-9f23-033449813713 · inbound

Training Transformers for KV Cache Compressibility cites this paper.

Training Transformers for KV Cache Compressibility Dynamic Chunking for End-to-End Hierarchical Sequence Modeling

Reference 22

Resolution
metadata mismatch
arxiv_id, observed 2026-05-13T06:02:21.965287Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-13T06:01:40.766843Z digest=sha256:1e555d861e32aaff4dace08c0913b642971a397ae5e343f1815a1b177ac4d084

Observation b29f30cb-3a3b-4380-b678-75054d02b7b5 · inbound

Efficient Pre-Training with Token Superposition cites this paper.

Efficient Pre-Training with Token Superposition Dynamic Chunking for End-to-End Hierarchical Sequence Modeling

Reference 27

Resolution
verified exact
arxiv_id, observed 2026-05-11T20:11:09.496813Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-08T10:09:56.187089Z digest=sha256:9d79cf1c374ed910036f40d74f5951e98386da12a852d7693fe6d802f1eec89d

Observation 87283113-8577-4712-aabd-af393c309a18 · inbound

Efficient Pre-Training with Token Superposition cites this paper.

Efficient Pre-Training with Token Superposition Dynamic Chunking for End-to-End Hierarchical Sequence Modeling

Reference 27

Resolution
verified exact
arxiv_id, observed 2026-05-20T22:59:11.977886Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-20T22:54:12.913665Z digest=sha256:fe142bdf35758c32d572570e3dc3c7c0723d9e93b6888cebd7e29e73196653d4

Observation c9d4a8af-d64c-413b-9b18-497755608a41 · inbound

Scratchpad Patching: Decoupling Compute from Patch Size in Byte-Level Language Models cites this paper.

Scratchpad Patching: Decoupling Compute from Patch Size in Byte-Level Language Models Dynamic Chunking for End-to-End Hierarchical Sequence Modeling

Reference 47

Resolution
metadata mismatch
arxiv_id, observed 2026-05-12T06:36:28.977825Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-05-12T04:05:28.713898Z digest=sha256:d3c6c0a129bc4ed6d30e7c034f7e3cf6dc5731c1295d608acb2ee946237f7817

Observation 5bc22454-e234-4525-85da-dc34b3bb6d6e · inbound

The Efficiency Gap in Byte Modeling cites this paper.

The Efficiency Gap in Byte Modeling Dynamic Chunking for End-to-End Hierarchical Sequence Modeling

Reference 26

Resolution
metadata mismatch
arxiv_id, observed 2026-05-14T19:47:53.733960Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-05-14T19:43:57.229794Z digest=sha256:7aa56f8dd867b1ece6c536b60825cba70737ccf74054b3cccdfb2c4be9c50d65

Observation 3ee531fb-19cc-4ae6-b67a-0ee47e57543a · inbound

LDARNet: DNA Adaptive Representation Network with Learnable Tokenization for Genomic Modeling cites this paper.

LDARNet: DNA Adaptive Representation Network with Learnable Tokenization for Genomic Modeling Dynamic Chunking for End-to-End Hierarchical Sequence Modeling

Reference 4

Resolution
metadata mismatch
arxiv_id, observed 2026-07-02T08:16:47.443536Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-06-28T06:17:32.321128Z digest=sha256:ddb0710efc160a0264e7b24ab2e0681ba3ff28d077248e339ca90d732bb724e2

Observation c7f77a73-d715-4759-b19d-fbc14e568886 · inbound

Neural Field Tokenizations with Hierarchy and Spatial Locality Priors cites this paper.

Neural Field Tokenizations with Hierarchy and Spatial Locality Priors Dynamic Chunking for End-to-End Hierarchical Sequence Modeling

Reference 3

Resolution
metadata mismatch
arxiv_id, observed 2026-07-02T20:47:22.508154Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-06-27T20:16:26.467398Z digest=sha256:39a1b31f151602ec031478b10928bdbfb079c756ae77c91431627313eeb28844

Observation 08a2fec7-5dfb-4c9e-a825-5daf0b3c6d3e · inbound

Elastic Time: Dynamic Frame Rate Bottlenecks for Neural Audio Coding cites this paper.

Elastic Time: Dynamic Frame Rate Bottlenecks for Neural Audio Coding Dynamic Chunking for End-to-End Hierarchical Sequence Modeling

Reference 31

Resolution
metadata mismatch
arxiv_id, observed 2026-07-04T14:59:54.991327Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-06-26T02:08:02.803410Z digest=sha256:f67b85c5802fc7a3fc966717306a70b195951861e777e8915b6f08055a951ebd

Observation 6494aeb3-e400-411d-b703-6b0bf216e61e · inbound

MultiHashFormer: Hash-based Generative Language Models cites this paper.

MultiHashFormer: Hash-based Generative Language Models Dynamic Chunking for End-to-End Hierarchical Sequence Modeling

Reference 16

Resolution
verified exact
arxiv_id, observed 2026-06-29T04:23:05.527666Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-06-29T04:13:05.082903Z digest=sha256:0c375aa0af2d67e3681f543777dd2df84dadd621fae98d2457b5364c6fb9f0e6

Observation a535243d-3c9b-471b-9c68-70963dd010cd · inbound

SUNTA: Hierarchical Video Prediction with Surprise-based Chunking cites this paper.

SUNTA: Hierarchical Video Prediction with Surprise-based Chunking Dynamic Chunking for End-to-End Hierarchical Sequence Modeling

Reference 25

Resolution
metadata mismatch
arxiv_id, observed 2026-07-03T13:28:18.363810Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-07-03T13:20:21.237349Z digest=sha256:d414ad36dfe808d84369cf943716a1d4beb655e9b7373f9834c5713eeb0c87db

Observation e3f2a25c-dfcc-4bc8-ade2-d8fda8275414 · inbound

SUNTA: Hierarchical Video Prediction with Surprise-based Chunking cites this paper.

SUNTA: Hierarchical Video Prediction with Surprise-based Chunking Dynamic Chunking for End-to-End Hierarchical Sequence Modeling

Reference 25

Resolution
unresolved
no resolver link, observed 2026-07-14T16:42:04.979573Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T16:42:04.979573Z digest=sha256:6f04d2708355e6e160e80fe0807d6d8db0b19dbd99be391023a6ff04aef323cc

Observation d5766850-77ea-4625-ae20-1d4e9ab4e451 · inbound

Where to cut, how deep: BPE and Unigram-LM on chemistry SMILES cites this paper.

Where to cut, how deep: BPE and Unigram-LM on chemistry SMILES Dynamic Chunking for End-to-End Hierarchical Sequence Modeling

Reference 16

Resolution
metadata mismatch
local_arxiv, observed 2026-07-11T03:47:48.606361Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-07-11T03:42:21.307552Z digest=sha256:f16b5ee5eba28e3a0a1cb1469cf8a66e0e387bd85b257c97bfd2d2c4e23fc886

Observation 9cebbb5d-a838-4eec-99b5-915c34068861 · inbound

Disentangling Language Modeling and Boundaries cites this paper.

Disentangling Language Modeling and Boundaries Dynamic Chunking for End-to-End Hierarchical Sequence Modeling

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-05T16:21:01.254302Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T16:21:01.254302Z digest=sha256:114a08735f963af49623e279fbb8093c5bcfe9151f2496d57e6d9ad7998121d6

Observation 18d42a9c-0e4c-44fd-aade-a9a5d2649be3 · inbound

Hierarchical Latent Prediction for Language Models cites this paper.

Hierarchical Latent Prediction for Language Models Dynamic Chunking for End-to-End Hierarchical Sequence Modeling

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T23:13:07.268239Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T23:13:07.268239Z digest=sha256:982ec5b785e6b4f5e6802d8c04136c684365f3c0ae09a635ceaf54227cfa136a