Pith. sign in

Paper Citation Record · LEDGER

Learning to Merge Tokens in Vision Transformers

As of 22 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 18 inbound Pith citation observations for arXiv:2202.12015.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2202.12015 v1

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 18 of 18 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-22T06:32:14.747728+00:00

measured 18 of 18 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-12T14:24:43.666009Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T05:09:36.498887Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation 25ff96d3-cf78-445f-9f06-c82026a0482d · inbound

Importance-Based Token Merging for Efficient Image and Video Generation cites this paper.

Importance-Based Token Merging for Efficient Image and Video Generation Learning to Merge Tokens in Vision Transformers

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-12T14:24:43.666009Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:24:43.666009Z digest=sha256:1df541afdafe07bc6534c9770b411f3235bd158f5918c6aa0c4e8d1251f8a26f

Observation 00a3141c-d13b-45e4-9626-8430adbb440a · inbound

SAT-HMR: Real-Time Multi-Person 3D Mesh Estimation via Scale-Adaptive Tokens cites this paper.

SAT-HMR: Real-Time Multi-Person 3D Mesh Estimation via Scale-Adaptive Tokens Learning to Merge Tokens in Vision Transformers

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-12T05:50:48.576118Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T05:50:48.576118Z digest=sha256:eb315d72dc25778adbde22c5e54a4b77f958ec0ecf2f00cc7ae5ce2338ee3610

Observation 3b089d5f-1ffe-4125-8d03-3b235bdca257 · inbound

Token Cropr: Faster ViTs for Quite a Few Tasks cites this paper.

Token Cropr: Faster ViTs for Quite a Few Tasks Learning to Merge Tokens in Vision Transformers

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-12T04:54:29.212832Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:54:29.212832Z digest=sha256:3a4c09accde86a5c7ffe43d80eb1f32d32d6dda0026c37e4d01c7d00eaa25d5f

Observation 2b52d29b-94fb-415b-a611-045ebc16810b · inbound

Mr. DETR++: Instructive Multi-Route Training for Detection Transformers with Mixture-of-Experts cites this paper.

Mr. DETR++: Instructive Multi-Route Training for Detection Transformers with Mixture-of-Experts Learning to Merge Tokens in Vision Transformers

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-11T16:33:54.724486Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T16:33:54.724486Z digest=sha256:b914d41cbd48b7b345eee59c248dd5c00cd2d8cc7f6b0688a879d20e34ee33fd

Observation fda73753-8bfc-40a1-aa23-7a488dad0657 · inbound

Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers cites this paper.

Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers Learning to Merge Tokens in Vision Transformers

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-11T15:58:37.631716Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T15:58:37.631716Z digest=sha256:925d3a1cc49a132cfb5266db4ed345f9333d0b0c98b38ffff7b14eff04ea0bfb

Observation e154e3af-75d3-4c8d-8666-840f1a9efd05 · inbound

Cross-Layer Cache Aggregation for Token Reduction in Ultra-Fine-Grained Image Recognition cites this paper.

Cross-Layer Cache Aggregation for Token Reduction in Ultra-Fine-Grained Image Recognition Learning to Merge Tokens in Vision Transformers

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-10T22:58:29.860345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T22:58:29.860345Z digest=sha256:b86b5592bd9ee6f9accc045a15724a649912f0ab1c28c06120e4b9b6f42be928

Observation 82aedb34-dc44-4a40-a5ed-7e9a5151120c · inbound

Identifying Critical Tokens for Accurate Predictions in Transformer-based Medical Imaging Models cites this paper.

Identifying Critical Tokens for Accurate Predictions in Transformer-based Medical Imaging Models Learning to Merge Tokens in Vision Transformers

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-10T14:19:42.445249Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:19:42.445249Z digest=sha256:c74ff0fc02144f58ec826181b53c219ffd1a2bf220d59eda9f66ed31531b6161

Observation 1912697c-1ac6-4bc8-98ed-0c468cee33b2 · inbound

Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing cites this paper.

Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing Learning to Merge Tokens in Vision Transformers

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-09T18:28:48.402338Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T18:28:48.402338Z digest=sha256:23d27dde011eb5e8422d42a0cd97a6fda8fa148d5ae1ba4c4d766ae9229b23b5

Observation c65e594d-c154-445b-a67a-def22ddd5241 · inbound

Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation cites this paper.

Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation Learning to Merge Tokens in Vision Transformers

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T05:01:23.804525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:01:23.804525Z digest=sha256:291a8b2d06ce087ce8b627d6da9e3a5f9c4f7cce7031e84cb4897a0291751836

Observation 06250222-426a-428f-9eb6-6a309faf1aba · inbound

Token Compression Meets Compact Vision Transformers: A Survey and Comparative Evaluation for Edge AI cites this paper.

Token Compression Meets Compact Vision Transformers: A Survey and Comparative Evaluation for Edge AI Learning to Merge Tokens in Vision Transformers

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T17:53:26.621820Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:53:26.621820Z digest=sha256:9bfcca868e87af5fafc27a47179a8cfcbc66ffcf515d6a7a97e030de21c1b37b

Observation 5bff8415-6a1c-46a9-8a94-14605872bba8 · inbound

Training-free Token Reduction for Vision Mamba cites this paper.

Training-free Token Reduction for Vision Mamba Learning to Merge Tokens in Vision Transformers

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-06T16:16:49.380798Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T16:16:49.380798Z digest=sha256:f6091d0fd0050f672a51a03c49093842a1d4017af9ae4428bfb7c78321650129

Observation 78e4a7eb-1f02-45fb-8b56-410e0465d0d5 · inbound

FastVGGT: Training-Free Acceleration of Visual Geometry Transformer cites this paper.

FastVGGT: Training-Free Acceleration of Visual Geometry Transformer Learning to Merge Tokens in Vision Transformers

Reference 17

Resolution
verified exact
arxiv_id, observed 2026-05-15T23:36:06.967355Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-05-15T23:36:06.870759Z digest=sha256:bd68483de363815838fd79133f568f5e83ee0d3cda69de5c8f225ba50dde7aa2

Observation 396f89f9-983c-400e-95c0-1009c09e924e · inbound

Token-Based Detection of Spurious Correlations in Vision Transformers cites this paper.

Token-Based Detection of Spurious Correlations in Vision Transformers Learning to Merge Tokens in Vision Transformers

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-05T10:31:37.375051Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T10:31:37.375051Z digest=sha256:58810e732da5ef0bb8e1a39fd5373457a5d0650d53f725361f50f8dfce0f9eba

Observation 64a6bd45-73c4-433e-8137-78834c6d13f6 · inbound

Revisiting Token Compression for Accelerating ViT-based Sparse Multi-View 3D Object Detectors cites this paper.

Revisiting Token Compression for Accelerating ViT-based Sparse Multi-View 3D Object Detectors Learning to Merge Tokens in Vision Transformers

Reference 37

Resolution
verified exact
arxiv_id, observed 2026-05-10T11:35:18.956741Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-05-10T11:31:52.126027Z digest=sha256:1239227bcd7cc4fa51433159aa08f0297a4d183684bdcf6a3ae2ef57b37d7911

Observation 934e1f69-e30d-4e48-bf54-9d239a0a191a · inbound

ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference cites this paper.

ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference Learning to Merge Tokens in Vision Transformers

Reference 55

Resolution
metadata mismatch
arxiv_id, observed 2026-07-04T03:19:29.913691Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-06-26T18:17:53.013043Z digest=sha256:938c500cd1195eea707c011a90a700bf1a0dead5116a1122673e4f10df20928d

Observation 43b2b66b-a933-4f03-ab63-9851d71c198b · inbound

ConsisFormer: Compute-Efficient Transformer for Wireless Foundation Models Based on Channel Consistency cites this paper.

ConsisFormer: Compute-Efficient Transformer for Wireless Foundation Models Based on Channel Consistency Learning to Merge Tokens in Vision Transformers

Reference 27

Resolution
verified exact
arxiv_id, observed 2026-07-04T05:09:36.501400Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-06-26T16:16:12.898027Z digest=sha256:ae9be19d7543ed5ab5a33af11349858eabb0cdaeb319e3c5139ff372825351e9

Observation 1943de30-9f1e-4531-82f7-11f2f0aaf79b · inbound

Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs cites this paper.

Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs Learning to Merge Tokens in Vision Transformers

Reference 31

Resolution
verified exact
arxiv_id, observed 2026-06-30T07:34:22.142467Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-06-30T07:24:59.159037Z digest=sha256:fc7f8fbc490c69a9805d7d2c601a5c119715c201d4545be0b8fd14fe249f7fa1

Observation f15b98f5-94d5-4933-a1a3-6035195e3a36 · inbound

REDI: Corpus Aware Patch Ranking for DINOv3 Token Reduction cites this paper.

REDI: Corpus Aware Patch Ranking for DINOv3 Token Reduction Learning to Merge Tokens in Vision Transformers

Reference 26

Resolution
verified exact
arxiv_id, observed 2026-07-01T09:55:41.643978Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-07-01T05:57:55.575289Z digest=sha256:4c65bc1079809d09a9b95a1e59e014809cec6c1a196bbe18146f225a5c7b2301