Pith. sign in

Paper Citation Record · LEDGER

TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?

As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 20 inbound Pith citation observations for arXiv:2106.11297.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2106.11297 v4

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 20 of 20 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-10T06:31:04.303077+00:00

measured 20 of 20 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-09T18:28:48.407448Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T16:39:57.309052Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation f5d6fb1a-b50a-43e6-b7e3-d0504daab814 · inbound

Florence: A New Foundation Model for Computer Vision cites this paper.

Florence: A New Foundation Model for Computer Vision TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?

Reference 19

Resolution
metadata mismatch
arxiv_id, observed 2026-05-16T09:38:09.558580Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-16T09:38:09.427509Z digest=sha256:5e9ae383f293b7008ca4f4d343abd6f0d41a4f11e44bc9911a21c8ba8c413926

Observation 30516c5a-679c-47c5-afd6-0be2ed571833 · inbound

PaLM-E: An Embodied Multimodal Language Model cites this paper.

PaLM-E: An Embodied Multimodal Language Model TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?

Reference 30

Resolution
metadata mismatch
arxiv_id, observed 2026-05-10T22:29:30.012482Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-10T22:29:29.631351Z digest=sha256:f9972a8e026b07241a0c675083e2161fe7a1283e710c93ef07943c25cec2d4db

Observation c39a0be2-f050-43b9-b048-64ff5f04c902 · inbound

Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing cites this paper.

Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-09T18:28:48.407448Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T18:28:48.407448Z digest=sha256:451e6a87940945c65047a61905356912bceee1ac521d84182d982d27d0aa626e

Observation faa12944-ddd0-4c44-b1b4-c285d500fa91 · inbound

One Trajectory, One Token: Grounded Video Tokenization via Panoptic Sub-object Trajectory cites this paper.

One Trajectory, One Token: Grounded Video Tokenization via Panoptic Sub-object Trajectory TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?

Reference 50

Resolution
verified exact
arxiv_id, observed 2026-05-19T12:57:17.864851Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-19T12:54:31.765909Z digest=sha256:5d1a0b5ec09aa3ae5d53f928d8e8ff782ef68c78cc4090cc77a226fba94d1a5f

Observation 20eb1f78-df11-452c-8d85-d2e28be4e7f5 · inbound

Cross-Modal Dual-Causal Learning for Long-Term Action Recognition cites this paper.

Cross-Modal Dual-Causal Learning for Long-Term Action Recognition TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-06T19:06:10.126258Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T19:06:10.126258Z digest=sha256:013a6ff26a43bb7511291c2f40e4636ba62bdfcf8a2f4b76585d9e18b4fefeb2

Observation 43973908-3670-483a-aa6a-24b75984db3a · inbound

Lightweight Backbone Networks Only Require Adaptive Lightweight Self-Attention Mechanisms cites this paper.

Lightweight Backbone Networks Only Require Adaptive Lightweight Self-Attention Mechanisms TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-06T05:44:19.783785Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T05:44:19.783785Z digest=sha256:c4b2627408730ac1bab4ded523634328f37c94d5c54ca81912556c5f94e3be20

Observation fbe25348-7814-438d-8213-2927ef1591f0 · inbound

Rethinking Visual Autoregressive Sampling with Information-Grounding Guidance cites this paper.

Rethinking Visual Autoregressive Sampling with Information-Grounding Guidance TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:15.404908Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:15.404908Z digest=sha256:18b7a3c600cb9f3106d64886d5acc6bbf3f68894a3fcbbe1f0d43fa94ecec92b

Observation 3f421aac-06a1-4aea-b0b3-ee1b5bee056f · inbound

A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large Language Models cites this paper.

A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large Language Models TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-03T21:31:35.530259Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:31:35.530259Z digest=sha256:c0644523bb3db4e0bcd9b6a85d26bc7f261732808a3759a733f9cf91c2ec2968

Observation a4b86630-081a-4e87-b794-675d41d62a52 · inbound

Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies cites this paper.

Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-03T03:56:05.496346Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T03:56:05.496346Z digest=sha256:55c73f7f9a84bf0eb6a354e29d0c4e8932075184ab07a1a7ae6748843fb822f6

Observation 165234c0-d7f8-4856-8725-9299041fa718 · inbound

VolumeDP: Modeling Volumetric Representation for Manipulation Policy Learning cites this paper.

VolumeDP: Modeling Volumetric Representation for Manipulation Policy Learning TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?

Reference 31

Resolution
unresolved
no resolver link, observed 2026-07-13T23:00:31.128534Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T23:00:31.128534Z digest=sha256:f9488dc9d0d0ce8330eeac55f23bcb243fbc5b387a101ce933bd5df0fe250d20

Observation 4406e2e2-1d2a-4158-b0ea-ec86cfa3b9d9 · inbound

Why Training-Free Token Reduction Collapses: The Inherent Instability of Pairwise Scoring Signals cites this paper.

Why Training-Free Token Reduction Collapses: The Inherent Instability of Pairwise Scoring Signals TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?

Reference 47

Resolution
metadata mismatch
arxiv_id, observed 2026-05-10T08:02:25.416558Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-05-10T07:59:10.678150Z digest=sha256:e676a25381e45419cdcfdfdc8593fa38782215980346710cdb5f8a3679cd3dda

Observation 2fef50d5-e49b-4462-81b9-bd9f7a21d282 · inbound

Head Similarity: Modeling Structured Whole-Head Appearance Beyond Face Recognition cites this paper.

Head Similarity: Modeling Structured Whole-Head Appearance Beyond Face Recognition TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?

Reference 60

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T02:55:52.997875Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-05-11T02:54:58.288120Z digest=sha256:176c6480fa23ff54f0c1eca6cfec4dde817df6b38740120b0a5b729bb24f7760

Observation febe5295-0f6b-4e26-9148-b2cca8ad8efd · inbound

FlowNar: Scalable Streaming Narration for Long-Form Videos cites this paper.

FlowNar: Scalable Streaming Narration for Long-Form Videos TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?

Reference 13

Resolution
metadata mismatch
arxiv_id, observed 2026-06-28T19:12:34.739821Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-06-28T19:08:36.655886Z digest=sha256:fcca46da4f0633f4fa75e96fea06ebeb86ac8c420cda4179a37dbbf53acab47e

Observation fa4617a4-e2da-43c2-a07c-c1e12f017da7 · inbound

See Less, Specify More: Visual Evidence Budgets for Generalizable VLAs cites this paper.

See Less, Specify More: Visual Evidence Budgets for Generalizable VLAs TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?

Reference 7

Resolution
verified exact
arxiv_id, observed 2026-07-01T23:36:24.027110Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-06-28T14:04:43.270155Z digest=sha256:ae7d19fb866f7e56d666f863e97a79f35dae39371e5d8ed29648f5e42ac1f29e

Observation 48025284-28ab-4294-8957-8eccd88a7b8f · inbound

Spatial-Aware Reduction Framework: Towards Efficient and Faithful Visual State Space Models cites this paper.

Spatial-Aware Reduction Framework: Towards Efficient and Faithful Visual State Space Models TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?

Reference 16

Resolution
metadata mismatch
arxiv_id, observed 2026-07-04T03:39:29.530970Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-06-26T17:53:38.503877Z digest=sha256:ce33efb7ca485c6e461fb91ceb48d9e0b58176b58333be9ea930c5f8104bac11

Observation b1d9f042-20ba-47ca-b090-35e5a176ecdb · inbound

EgoSAT: A Comprehensive Benchmark of Egocentric Streaming Interaction Understanding cites this paper.

EgoSAT: A Comprehensive Benchmark of Egocentric Streaming Interaction Understanding TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?

Reference 30

Resolution
verified exact
arxiv_id, observed 2026-07-04T16:39:57.310471Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-06-26T00:26:33.306128Z digest=sha256:615060a32a54e05758fe2e1df6ae16ef03817772cdba55cfc81df3daccb90952

Observation f721aee8-9c59-4278-b5f7-33c600d4a454 · inbound

DinoLink: A Token-Centric Representation Compression Framework for Bandwidth-Constrained Collaborative V2X Perception cites this paper.

DinoLink: A Token-Centric Representation Compression Framework for Bandwidth-Constrained Collaborative V2X Perception TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?

Reference 13

Resolution
verified exact
arxiv_id, observed 2026-07-04T15:49:57.573225Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-06-26T01:19:37.860746Z digest=sha256:edc971ddd234b48ac3c0945f83217837e52ac8c227caf341d6f2799275dc9035

Observation b299ec41-e64c-4819-94c5-0e0e881431e2 · inbound

DinoLink: A Token-Centric Representation Compression Framework for Bandwidth-Constrained Collaborative V2X Perception cites this paper.

DinoLink: A Token-Centric Representation Compression Framework for Bandwidth-Constrained Collaborative V2X Perception TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?

Reference 14

Resolution
verified exact
arxiv_id, observed 2026-07-01T09:35:40.915278Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-07-01T06:24:11.726818Z digest=sha256:4d4f93b481e91624da0f9a97e0f07ae1a0eddf60ec2a7f46290523231f72c0d2

Observation e59ce50a-90e3-4220-a333-c8ae05a661d9 · inbound

ATS-ToDMA: Adaptive Token Selection and Token-Domain Multiple Access for Cross-Modal Semantic Communications cites this paper.

ATS-ToDMA: Adaptive Token Selection and Token-Domain Multiple Access for Cross-Modal Semantic Communications TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?

Reference 14

Resolution
unresolved
no resolver link, observed 2026-07-12T01:55:58.109603Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T01:55:58.109603Z digest=sha256:8fd3d58dbae8b8ac9e5a4f339b4d25ca7de74f93761c2be6bae8716cb7e6af19

Observation 4d53f9a7-1533-4aa6-8abd-329d56327106 · inbound

Brain-Aligned Multi-Stream Video Transformers with Sparse Self-Selection cites this paper.

Brain-Aligned Multi-Stream Video Transformers with Sparse Self-Selection TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-01T17:32:32.351486Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T17:32:32.351486Z digest=sha256:9cdb6b631a80342c76a0248b85696668fdc6874878edd9219cee6a7ee1ccc42e