Pith. sign in

Paper Citation Record · LEDGER

Vision Foundation Models as Generalist Tokenizers for Image Generation

As of 18 August 2026, this Paper Citation Record lists 100 of 104 outbound references and 1 inbound Pith citation observation for arXiv:2605.18390.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2605.18390 v1

Coverage vector

measured 100 of 104 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-05-20T11:01:24.738195Z

measured 101 of 101 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-17T06:30:58.91139+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-07-10T07:31:26.225257Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-07-10T07:36:58.009410Z

Reference resolution

100 of 104 outbound references displayed

  • verified exact38
  • verified fuzzy56
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch6

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 4e9bae38-76a3-4f26-b64d-6a8f9dc687b5 · outbound

This paper cites Building Normalizing Flows with Stochastic Interpolants.

Vision Foundation Models as Generalist Tokenizers for Image Generation Building Normalizing Flows with Stochastic Interpolants

Reference 1

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.434134Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:7f592b3a4e7bb75244ea49c29406a8f81623f4fb98ce2bff8d6ae194814be8a3

Observation 9ae82e62-88a1-428b-a51c-052472268aac · outbound

This paper cites FlexTok: Resampling Images into 1D Token Sequences of Flexible Length.

Vision Foundation Models as Generalist Tokenizers for Image Generation FlexTok: Resampling Images into 1D Token Sequences of Flexible Length

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-05-20T11:03:13.436862Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:bea588399334b62237874bf33959ae81a77f1eb00e1231a26d259ba934ea95a0

Observation c661347a-3350-49e0-91cf-d1b0c1dadefb · outbound

This paper cites Autoencoders.

Vision Foundation Models as Generalist Tokenizers for Image Generation Autoencoders

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.293257Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:69c18ea1cf152b9a4f1830c5b46ea1660b9d6d9c97d68b3cad29bbadc75d5b0f

Observation 2e79dfd9-c309-4ec6-a2c8-d2073b2c8f41 · outbound

This paper cites Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation.

Vision Foundation Models as Generalist Tokenizers for Image Generation Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation

Reference 4

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.419677Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:f04733af173a420df0d53aece6e65d1c8146ab41952cdc5d75b0b537980e9fd8

Observation 64ab607e-1f3c-4490-87e5-35bf5614a5aa · outbound

This paper cites VFM-VAE: Vision Foundation Models Can Be Good Tokenizers for Latent Diffusion Models.

Vision Foundation Models as Generalist Tokenizers for Image Generation VFM-VAE: Vision Foundation Models Can Be Good Tokenizers for Latent Diffusion Models

Reference 5

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.509258Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:91c7b9e828d145aa1e5be1320f34234ce0f9b13ffa522edd7782ece40f02fa29

Observation 0e330b87-a4c2-4292-8f06-e354d8e348be · outbound

This paper cites Understanding disentangling in $\beta$-VAE.

Vision Foundation Models as Generalist Tokenizers for Image Generation Understanding disentangling in $\beta$-VAE

Reference 6

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.499461Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:6b0baf7a71508f3864f30a623b0ca78fd4fd534079e0709ebf691430cc28c837

Observation 6531e696-8726-40cd-bc48-12cb9c65919e · outbound

This paper cites Emerging proper- ties in self-supervised vision transformers.

Vision Foundation Models as Generalist Tokenizers for Image Generation Emerging proper- ties in self-supervised vision transformers

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:14.381692Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:a01967d0989dbb8ffc5673c4d73d1a67e86ec3b6fa2ae12c93b5a9810c9ca7a0

Observation 577fd82e-2723-4dcc-9376-5c734c9ba9f1 · outbound

This paper cites Maskgit: Masked generative image transformer.

Vision Foundation Models as Generalist Tokenizers for Image Generation Maskgit: Masked generative image transformer

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.369006Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:506657c6f57560e502609d41b0b387373e6c592b10ff7000e79c923aa8d15ee4

Observation 7f62fa5b-83c5-4d07-abe2-462a66b270e9 · outbound

This paper cites arXiv preprint arXiv:2509.25162 (2025) 4.

Vision Foundation Models as Generalist Tokenizers for Image Generation arXiv preprint arXiv:2509.25162 (2025) 4

Reference 9

Resolution
metadata mismatch
arxiv_id, observed 2026-05-20T11:03:13.446398Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:a7c75dc3938f59862a068a2a21d7933f97c36d1791d5ec50ee51a58a4d9bd0c8

Observation 86b6e111-fbb5-4e10-820e-31a75b6bc23b · outbound

This paper cites Generative pretraining from pixels.

Vision Foundation Models as Generalist Tokenizers for Image Generation Generative pretraining from pixels

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.361169Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:eef20ee097af7e761116c73f5b8406fb947d106072dfa1aa6bf32a490dca3725

Observation ff4ac094-3b5e-49b8-8662-4d07118b6c23 · outbound

This paper cites Improved Baselines with Momentum Contrastive Learning.

Vision Foundation Models as Generalist Tokenizers for Image Generation Improved Baselines with Momentum Contrastive Learning

Reference 11

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.536627Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:4ffdbb1c2fa2b7f11f56d078011c9aab4cf433c490cf5e2368130ab1189bbb26

Observation 3d8dbb5b-cc5f-4de4-8bf1-fdf35db38174 · outbound

This paper cites Detection in crowded scenes: One proposal, multiple predictions.

Vision Foundation Models as Generalist Tokenizers for Image Generation Detection in crowded scenes: One proposal, multiple predictions

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.331216Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:60d610bebed49ff38fba0693422aaa2589ceb57ea2b370a75273faf6abd097d7

Observation e26eeeb9-6e02-437e-ac6d-78c6afd63313 · outbound

This paper cites Deformable convolutional networks.

Vision Foundation Models as Generalist Tokenizers for Image Generation Deformable convolutional networks

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:14.390167Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:b1211b953dd49e8b9d7346adce58961e3e0f49d65f9f7fd08ef974274d331476

Observation b9bfbb4f-1db2-49bd-9bbc-7ca5cd2704d4 · outbound

This paper cites Vision Transformers Need Registers.

Vision Foundation Models as Generalist Tokenizers for Image Generation Vision Transformers Need Registers

Reference 14

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.547925Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:e889da79086066577ec7edbe23e55c30d1e8d231cb001cd72e4cffacb363a53e

Observation aeedf7ae-d146-4186-9207-db5d53c7a1ab · outbound

This paper cites Imagenet: A large-scale hierarchical image database.

Vision Foundation Models as Generalist Tokenizers for Image Generation Imagenet: A large-scale hierarchical image database

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.312779Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:91b17d7de2e721de1de7732413a9b71ffe9b77af950aca2e7004bc3d95134f29

Observation cf1cc1b3-746e-486f-a51d-46860a78ac60 · outbound

This paper cites Bert: Pre-training of deep bidirectional transform- ers for language understanding.

Vision Foundation Models as Generalist Tokenizers for Image Generation Bert: Pre-training of deep bidirectional transform- ers for language understanding

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:14.383783Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:f455ca8248bb7cfadc04e9cc8a0dbe74d0f92dfce9a75ab7b3cbc8ffcf0cc9f9

Observation fa51abb2-360b-4f8e-88ab-5d997fa4d3e5 · outbound

This paper cites Diffusion models beat gans on image synthesis.

Vision Foundation Models as Generalist Tokenizers for Image Generation Diffusion models beat gans on image synthesis

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.366414Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:ea0de353b1d123e383e3d72dca6eb59208963e6793085051c9a1640a7c0e5dc1

Observation 4fb7f249-21f0-464f-882c-6328b9301c73 · outbound

This paper cites An introduction to variational autoencoders.

Vision Foundation Models as Generalist Tokenizers for Image Generation An introduction to variational autoencoders

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:14.392237Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:5c1ab6a768cfba3bc21bcbd3438110b0726578db33adfc5eef403314391284f5

Observation 26638286-bf8c-4de3-9fe1-611ef3610a89 · outbound

This paper cites An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale.

Vision Foundation Models as Generalist Tokenizers for Image Generation An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale

Reference 19

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.518133Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:aa2e94139dffacd3e46d1fe2803825bd7fef2f227e2183b4b3bfeff6c46995a2

Observation 2b4e0f94-ff25-42cb-a88a-fa90513818f2 · outbound

This paper cites Scaling rectified flow transformers for high- resolution image synthesis.

Vision Foundation Models as Generalist Tokenizers for Image Generation Scaling rectified flow transformers for high- resolution image synthesis

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.378602Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:c04e0774a2561e375cd9da23f97e66a1d631d94f21402e9ad3e706c7fb8dd37c

Observation 6abe7458-1044-4e66-bb07-dacdc7e82c62 · outbound

This paper cites Taming transformers for high-resolution image synthesis.

Vision Foundation Models as Generalist Tokenizers for Image Generation Taming transformers for high-resolution image synthesis

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:14.377192Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:e2ca595866f4b0bcb7668a099781a1d18e475de4f8f2950b7346a97aae6f6941

Observation 1f77c73d-7e69-4ecc-83ed-81eda16fc45b · outbound

This paper cites One layer is enough: Adapting pretrained visual encoders for image generation.

Vision Foundation Models as Generalist Tokenizers for Image Generation One layer is enough: Adapting pretrained visual encoders for image generation

Reference 23

Resolution
verified exact
arxiv_id, observed 2026-05-20T11:03:13.478362Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:e70a07248f21721c19a582d2e6b44869ad99706bd8000b514e885ddcaac96143

Observation 8b4c9a63-dc23-436c-b93a-47a3c8d8824c · outbound

This paper cites Generative adversarial networks.

Vision Foundation Models as Generalist Tokenizers for Image Generation Generative adversarial networks

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.278967Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:858cf5163c383c7b7333383da80ef245e830946ced45ed9276ab0cf6dae10253

Observation 7ef378e6-3f7d-4a45-9540-4a2dc0c8e1a4 · outbound

This paper cites Bootstrap your own latent-a new approach to self-supervised learning.

Vision Foundation Models as Generalist Tokenizers for Image Generation Bootstrap your own latent-a new approach to self-supervised learning

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.376255Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:e864b31f408388854f17c3539c2b000890465ce9033dfbe6ec35c0015a866de9

Observation a0bbab4b-173f-4e72-9dca-99de3929f7dc · outbound

This paper cites Learnings from Scaling Visual Tokenizers for Reconstruction and Generation.

Vision Foundation Models as Generalist Tokenizers for Image Generation Learnings from Scaling Visual Tokenizers for Reconstruction and Generation

Reference 26

Resolution
verified exact
arxiv_id, observed 2026-05-20T11:03:13.439682Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:12d8e38d4fed2b61ec708247e0a929861bef3af61870d8518873382f8b697326

Observation a16a26aa-333c-49e9-854b-f1be08784c49 · outbound

This paper cites Masked autoencoders are scalable vision learn- ers.

Vision Foundation Models as Generalist Tokenizers for Image Generation Masked autoencoders are scalable vision learn- ers

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.363974Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:46cb49861a63fc22f4c74af00c2b4d286979a1ff51b23ac4e765985691161802

Observation e56fbd35-ca4f-4507-9bc9-783a3df32da7 · outbound

This paper cites Momentum Contrast for Unsupervised Visual Representation Learning.

Vision Foundation Models as Generalist Tokenizers for Image Generation Momentum Contrast for Unsupervised Visual Representation Learning

Reference 28

Resolution
verified exact
arxiv_id, observed 2026-05-20T11:03:13.423013Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:4e6c8712565df63931e835bb221588549159345e9b2498209e2dd0adfc3fdbfa

Observation 019a7724-c873-49db-8112-7d6f1cf05ccf · outbound

This paper cites Deep residual learning for image recognition.

Vision Foundation Models as Generalist Tokenizers for Image Generation Deep residual learning for image recognition

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.349242Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:8bdb2f6b8b05d03d8d94b66ae39a237ead536850116ae26b51313571d3a1ace4

Observation d90035ae-f1a2-4a67-92e1-67019c71184f · outbound

This paper cites Gans trained by a two time-scale update rule converge to a local nash equilibrium.

Vision Foundation Models as Generalist Tokenizers for Image Generation Gans trained by a two time-scale update rule converge to a local nash equilibrium

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.388477Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:cf9e0b4938b4896071c5c9ec68cf499094b06a209c19d0b2a574837b2cce5eb5

Observation 6e09baef-298c-4181-b4e9-5b6504b1ba1d · outbound

This paper cites Burgess, Xavier Glorot, Matthew M.

Vision Foundation Models as Generalist Tokenizers for Image Generation Burgess, Xavier Glorot, Matthew M

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.381015Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:6fbbc500786f6f3443d7294f6e60bc814de93a014195de6ad8d6a2f3770aa9f0

Observation 0b37b325-454d-44e1-a563-a8013fd3d1d8 · outbound

This paper cites Denoising diffusion probabilistic models.

Vision Foundation Models as Generalist Tokenizers for Image Generation Denoising diffusion probabilistic models

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.303957Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:43ce6a13e703a17ba736188efb148d5eedb39415182951fcbc6da72e6c9d786f

Observation f0585fe7-5767-4c77-b329-bd31a01ef568 · outbound

This paper cites Image-to-image translation with conditional adversarial networks.

Vision Foundation Models as Generalist Tokenizers for Image Generation Image-to-image translation with conditional adversarial networks

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.339587Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:0ded51703a5a08bd62d315f56d4fbdb967182d05c7002ffd53947d43157dd5d0

Observation 4f8e6445-fe22-44e2-bc70-80fa8f60ab3d · outbound

This paper cites Image-to-image translation with conditional adversarial networks.

Vision Foundation Models as Generalist Tokenizers for Image Generation Image-to-image translation with conditional adversarial networks

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:14.386054Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:120927eaac80b333033c0156baec98c86de0bcb94b50be30d9b5a1c049466de6

Observation 6045b28b-f457-4b1b-8ed7-45394e3763fd · outbound

This paper cites Scaling up visual and vision-language representation learning with noisy text supervision.

Vision Foundation Models as Generalist Tokenizers for Image Generation Scaling up visual and vision-language representation learning with noisy text supervision

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:14.394674Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:86bd3fd0d1c0a9dd351a9e01aacf89a98f0d090218aa7cfcac59cd49b0b81223

Observation e6f2b59b-2ad7-4f60-b5fe-c988e04c6c37 · outbound

This paper cites Guiding a diffusion model with a bad version of itself.

Vision Foundation Models as Generalist Tokenizers for Image Generation Guiding a diffusion model with a bad version of itself

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:14.388264Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:1fa1c96f7c6d2d964223f54bd5855967b2eaa758cd381dcfafcab54b29f6d946

Observation 54e3dc9e-5f26-49ef-a986-f4649d371537 · outbound

This paper cites A style-based generator architecture for generative adversarial networks.

Vision Foundation Models as Generalist Tokenizers for Image Generation A style-based generator architecture for generative adversarial networks

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:14.379637Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:4a9e855322a6e33761264110d8b87013e071d845861c2e70083b2adb7d3cc82f

Observation 4a9803c4-5bfe-4788-8ace-3196d619838b · outbound

This paper cites Auto-Encoding Variational Bayes.

Vision Foundation Models as Generalist Tokenizers for Image Generation Auto-Encoding Variational Bayes

Reference 38

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.492647Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:a136f31a3a73ac842dc91d1847776408756465ee36c4ff8b476d0aacedec236b

Observation c029ead1-642e-473d-8cc9-581b4d1971e7 · outbound

This paper cites EQ-VAE: Equivariance Regularized Latent Space for Improved Generative Image Modeling.

Vision Foundation Models as Generalist Tokenizers for Image Generation EQ-VAE: Equivariance Regularized Latent Space for Improved Generative Image Modeling

Reference 39

Resolution
verified exact
arxiv_id, observed 2026-05-20T11:03:13.461031Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:faf6572dc866001249eebfb65cab53b5e1f6bfceec92c8cafacd29ff1da5b040

Observation daf38ee2-127c-4aac-a920-8d83afc4b710 · outbound

This paper cites arXiv preprint arXiv:2504.16064 , year=.

Vision Foundation Models as Generalist Tokenizers for Image Generation arXiv preprint arXiv:2504.16064 , year=

Reference 40

Resolution
metadata mismatch
arxiv_id, observed 2026-05-20T11:03:13.528025Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:ed820b8392d2ec958f8396071744cd2ce25777ff8fd12eb73c095e890e90d10f

Observation 21c00f1e-307c-4e1f-900c-12ff3fa1da0e · outbound

This paper cites The open images dataset v4: Unified image classification, object detection, and visual relationship detection at scale.

Vision Foundation Models as Generalist Tokenizers for Image Generation The open images dataset v4: Unified image classification, object detection, and visual relationship detection at scale

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:14.375115Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:5f3b6bbaaabda8a791bb474877ca8fddd1008ad1516ce5d7e64fd1d48b90fc6f

Observation 7df956ba-741f-44d6-9e2e-3a05b3bc4ab1 · outbound

This paper cites Improved precision and recall metric for assessing generative models.

Vision Foundation Models as Generalist Tokenizers for Image Generation Improved precision and recall metric for assessing generative models

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:14.370758Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:a1e9c0ca3c9f8fdba337df8ee0541ef8c981bf073d9f6142261c9f599477d94b

Observation 54a38ccd-6ccb-43d5-b38a-bca635aaeadd · outbound

This paper cites Autoregressive image generation using residual quantization.

Vision Foundation Models as Generalist Tokenizers for Image Generation Autoregressive image generation using residual quantization

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:14.372801Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:908cea3ae4e18812610c98e9f92ccdc4da1f8a95c7a316e5768f5a632e387bc9

Observation 8943d534-2bfb-4ca8-a019-d727ef7a622c · outbound

This paper cites Repa-e: Unlocking vae for end-to-end tuning with latent diffusion transformers.

Vision Foundation Models as Generalist Tokenizers for Image Generation Repa-e: Unlocking vae for end-to-end tuning with latent diffusion transformers

Reference 44

Resolution
verified exact
arxiv_id, observed 2026-05-20T11:03:13.520976Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:bb66509216219811debb2f86821b0b71ca4b703af332b760d37c80a6c2ec265d

Observation dad91f52-f94d-41cf-9d64-0f721ae82904 · outbound

This paper cites Autoregressive Image Generation without Vector Quantization.

Vision Foundation Models as Generalist Tokenizers for Image Generation Autoregressive Image Generation without Vector Quantization

Reference 45

Resolution
verified exact
arxiv_id, observed 2026-05-20T11:03:13.515389Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:97145af5208c5262e7b137d77b6a0c9a27a8ae9a579bbe36352f6d1f999567e6

Observation 35a3c3f3-f2dc-45c9-a751-5897e4c373f8 · outbound

This paper cites ImageFolder: Autoregressive Image Generation with Folded Tokens.

Vision Foundation Models as Generalist Tokenizers for Image Generation ImageFolder: Autoregressive Image Generation with Folded Tokens

Reference 46

Resolution
verified exact
arxiv_id, observed 2026-05-20T11:03:13.505362Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:716ef073498d7633d6ee44d03183de17a6fb9524cccf7c83491ec452b45508a1

Observation 5acccd36-1bd9-4940-949d-0244ff1b5051 · outbound

This paper cites Feature pyramid networks for object detection.

Vision Foundation Models as Generalist Tokenizers for Image Generation Feature pyramid networks for object detection

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.319767Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:d69160a494097c72c779dcf297c0d2162199647be06f85a638178fca903e4fcb

Observation d5aae5c8-23ec-46d4-92e2-49c1d50c9d0a · outbound

This paper cites Focal loss for dense object detection.

Vision Foundation Models as Generalist Tokenizers for Image Generation Focal loss for dense object detection

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.371277Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:1c701962f3b57ba95ee37cbe5172664ee0bbf6e7741278d6c397983f49097954

Observation 2a2f07b2-511f-4463-9d9b-f517be4a0f6a · outbound

This paper cites Flow Matching for Generative Modeling.

Vision Foundation Models as Generalist Tokenizers for Image Generation Flow Matching for Generative Modeling

Reference 49

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.474843Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:ba0e99689fa6702c12d4d29d0353fcb3725192b5df0ab2ccec4d9b34f2f4c5d6

Observation 22c21af5-a7c8-4c39-86d7-17f6d34aa6f1 · outbound

This paper cites Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow.

Vision Foundation Models as Generalist Tokenizers for Image Generation Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow

Reference 50

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.452207Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:a7b12dc8e6f80302a76639d5257c9928b7786b47b1ef684e447c7fa958dfbab1

Observation 442793b9-5d8d-4c0b-a763-7028d8ec488a · outbound

This paper cites Decoupled Weight Decay Regularization.

Vision Foundation Models as Generalist Tokenizers for Image Generation Decoupled Weight Decay Regularization

Reference 51

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.442381Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:2a6238b1b592fffcced662625bde3647cc7de011e65c9a0a21f47afa35cc6691

Observation 3ec1f911-62c2-4e81-9af7-34807fb6efb5 · outbound

This paper cites Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation.

Vision Foundation Models as Generalist Tokenizers for Image Generation Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation

Reference 52

Resolution
verified exact
arxiv_id, observed 2026-05-20T11:03:13.484061Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:c64deac9f44231e60bf3652f5e4eef664081536f95fbd4ad9d417e87d3e91fc8

Observation ac649c53-4f79-42db-9414-97c75499300d · outbound

This paper cites Sit: Exploring flow and diffusion-based generative models with scalable interpolant transformers.

Vision Foundation Models as Generalist Tokenizers for Image Generation Sit: Exploring flow and diffusion-based generative models with scalable interpolant transformers

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.354139Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:cff8829ec1751d66136a99e0c871ecf5f6f6d97863f7f69574d61ed9de711e1b

Observation ea9248bc-495a-4754-86c0-9445a46f9fd5 · outbound

This paper cites Finite Scalar Quantization: VQ-VAE Made Simple.

Vision Foundation Models as Generalist Tokenizers for Image Generation Finite Scalar Quantization: VQ-VAE Made Simple

Reference 54

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.533895Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:d82faec701ead004d0c2bda393a1f0ee99d40b43185aace1b28bb14ab05c74f7

Observation c1d8f6c1-2c4e-44db-917f-b19d81e6b7ca · outbound

This paper cites Conditional Generative Adversarial Nets.

Vision Foundation Models as Generalist Tokenizers for Image Generation Conditional Generative Adversarial Nets

Reference 55

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.463672Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:507979d2605559b6725d9bfa4d8537cbb0ccc330b2d7f357ce769fa9d28b3994

Observation 28ed9a64-345d-4177-b51e-004c01d54576 · outbound

This paper cites One-D-Piece: Image Tokenizer Meets Quality-Controllable Compression.

Vision Foundation Models as Generalist Tokenizers for Image Generation One-D-Piece: Image Tokenizer Meets Quality-Controllable Compression

Reference 56

Resolution
verified exact
arxiv_id, observed 2026-05-20T11:03:13.539717Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:34d84f860b2b3e34a0f796b6165e7df18ab0fcea17525e6eb7d5968717c5e2e3

Observation 679b6030-91bb-4466-b6d5-635efde81828 · outbound

This paper cites Improved denois- ing diffusion probabilistic models.

Vision Foundation Models as Generalist Tokenizers for Image Generation Improved denois- ing diffusion probabilistic models

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.290062Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:8c7f94469ee6b4c51b95505b57fc7bb1c6dddb51d03c505ab6b30ba894f4ef38

Observation 482d5ab3-81ca-4b87-871b-1a90bc3555b4 · outbound

This paper cites DINOv2: Learning Robust Visual Features without Supervision.

Vision Foundation Models as Generalist Tokenizers for Image Generation DINOv2: Learning Robust Visual Features without Supervision

Reference 58

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.545158Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:439c9b7f68f0e25882b5ff345d462a67de23ef10b01231b05509182690cf50ac

Observation 03df1eec-62d9-4851-8293-a9205af759c1 · outbound

This paper cites Scalable diffusion models with transformers.

Vision Foundation Models as Generalist Tokenizers for Image Generation Scalable diffusion models with transformers

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.351517Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:f6db5d21acd03afc5e0d8d64561765220c25b85facdc790e535b0c29894bd91d

Observation ab1bc623-546d-41bc-9581-ddde19cc7ab6 · outbound

This paper cites TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation.

Vision Foundation Models as Generalist Tokenizers for Image Generation TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation

Reference 60

Resolution
verified exact
arxiv_id, observed 2026-05-20T11:03:13.455436Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:e769d36b648740c1b29051469d19bf547c17b088a691621197615c1c8cb1c234

Observation 706f594e-e853-4a1b-bbb9-1029e9398825 · outbound

This paper cites Learning transferable visual models from natural language super- vision.

Vision Foundation Models as Generalist Tokenizers for Image Generation Learning transferable visual models from natural language super- vision

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.308567Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:3713368f6470f6c3dcc5c7c0e0b600eeb6baaa21245221c4ac02de9f2875f423

Observation 5f3a9e1e-5e47-41bc-9b62-e5e1fca80fb7 · outbound

This paper cites Unsupervised Representation Learning with Deep Convolutional Generative Adversarial Networks.

Vision Foundation Models as Generalist Tokenizers for Image Generation Unsupervised Representation Learning with Deep Convolutional Generative Adversarial Networks

Reference 62

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.481008Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:cbd89014122a411a3284825924c6fd3b953cb9990c5eb7beec001414d54d7475

Observation a295e7ff-2403-452d-b365-6f7fe6d4121c · outbound

This paper cites Improving language understanding by generative pre-training.

Vision Foundation Models as Generalist Tokenizers for Image Generation Improving language understanding by generative pre-training

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.373837Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:569cd4a0a756525a9e7c445bf5655464f71b26df3cd5fe6fd7f3ba9763b3744f

Observation 41b546d7-5b6d-44bd-b9c1-a05bee75204c · outbound

This paper cites Generating diverse high-fidelity images with vq-vae-2.

Vision Foundation Models as Generalist Tokenizers for Image Generation Generating diverse high-fidelity images with vq-vae-2

Reference 64

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.386066Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:5624849e306b4dccab09fcca0bdfa6199448229c1c051315e4e5b7a334c98372

Observation 3839fa64-2f4e-4618-85ef-7ee48050a721 · outbound

This paper cites High-resolution image synthesis with latent diffusion models.

Vision Foundation Models as Generalist Tokenizers for Image Generation High-resolution image synthesis with latent diffusion models

Reference 65

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.336515Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:92370fb2bde56665ae9b3a501817d0b1767e45443a6ea5036b84346dd09d684d

Observation 0148ab18-6fe6-454d-bc10-ca9f1d64189d · outbound

This paper cites Photorealistic text-to-image diffusion models with deep language understanding.

Vision Foundation Models as Generalist Tokenizers for Image Generation Photorealistic text-to-image diffusion models with deep language understanding

Reference 66

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.296277Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:60cbeee972a3b36de539cc14f8ce562223fcb1e9083e879fbeb7db74db947230

Observation 5b69732e-982d-40db-9847-e8e7ce214bfd · outbound

This paper cites Improved techniques for training gans.

Vision Foundation Models as Generalist Tokenizers for Image Generation Improved techniques for training gans

Reference 67

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.390939Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:870dbead5375b937d09c20853d3fe500b92ad0c382ce36a9c4fdbfd7a6ba090c

Observation c79eb551-b8f4-470f-893d-aedf7ba3b0ca · outbound

This paper cites Improved techniques for training gans.

Vision Foundation Models as Generalist Tokenizers for Image Generation Improved techniques for training gans

Reference 68

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.347031Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:923f45453606f3a1c1f7d1ca4c064fdcd59d79be4bf1e1dfc74f62edd7a8c792

Observation 38afef1b-136f-48a9-b668-02f7675e4f8d · outbound

This paper cites Denoising Diffusion Implicit Models.

Vision Foundation Models as Generalist Tokenizers for Image Generation Denoising Diffusion Implicit Models

Reference 69

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.530872Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:599b99633048102127abe3230dddaa005a2f6de8b9eaf24dab275cab6e593132

Observation d7ce9777-833b-4ecf-bce9-29c32b809eb1 · outbound

This paper cites DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies.

Vision Foundation Models as Generalist Tokenizers for Image Generation DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies

Reference 70

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.490028Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:c8f19c759732b222eb91b14c8436a459965f688a721532c23ed06159e1f6ef3f

Observation 8a6cc765-4bf0-43bd-99e5-aabdf14ca6b0 · outbound

This paper cites Roformer: Enhanced transformer with rotary position embedding.

Vision Foundation Models as Generalist Tokenizers for Image Generation Roformer: Enhanced transformer with rotary position embedding

Reference 71

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.317427Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:1c9289b9ae0a238557f57bd1af5a7d36cb0d4ba72ffe5a71a29b40511a3d5c95

Observation b5d0087d-6a23-48b5-8005-31327366d18d · outbound

This paper cites Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation.

Vision Foundation Models as Generalist Tokenizers for Image Generation Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation

Reference 72

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.502671Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:3579b18df898ea33a9850656b093291e264a33b6e217143f7be9edf19dbf499d

Observation cea157d7-0fdc-4739-b4a2-12f7404084e4 · outbound

This paper cites Rethinking the inception architecture for computer vision.

Vision Foundation Models as Generalist Tokenizers for Image Generation Rethinking the inception architecture for computer vision

Reference 73

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.321992Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:9a6b98b5103627f91b9f21900b408e0b2e84ef5c91c458f2675b0831dedf9f71

Observation 78470744-c66c-40b4-af5c-a17b0d24c63b · outbound

This paper cites Unilip: Adapting clip for unified multimodal understanding, generation and editing.

Vision Foundation Models as Generalist Tokenizers for Image Generation Unilip: Adapting clip for unified multimodal understanding, generation and editing

Reference 74

Resolution
verified exact
arxiv_id, observed 2026-05-20T11:03:13.558830Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:67a1c61697525c02208b4ecc4b0dc3df233ee4a4242ddb93dd0d35ef7337d266

Observation 6a3834f3-bfc7-4c5b-bde3-a61da64e68a9 · outbound

This paper cites Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction.

Vision Foundation Models as Generalist Tokenizers for Image Generation Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction

Reference 75

Resolution
metadata mismatch
arxiv_id, observed 2026-05-20T11:03:13.431357Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:ac3a3863acbbfecd3675005e58e23c0ced878b5701b7a660b2dfa2d35b4adb64

Observation e31dac73-9b9c-4d41-ad24-aa928e3d3772 · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

Vision Foundation Models as Generalist Tokenizers for Image Generation LLaMA: Open and Efficient Foundation Language Models

Reference 76

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.542703Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:eb588def7f54748f30150ddff40585f54acc7b602373eeba85a790e4e60d7cdb

Observation 67f30945-4866-4694-97f0-29fd7f691ae1 · outbound

This paper cites SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features.

Vision Foundation Models as Generalist Tokenizers for Image Generation SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features

Reference 77

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.512117Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:df8fb680e0630b18bdfdf7fa71381d197ae0e4c99a6813f51c26de072061b7ee

Observation 11e29742-d5f7-4b76-9def-091f416dd664 · outbound

This paper cites Conditional 15 image generation with pixelcnn decoders.

Vision Foundation Models as Generalist Tokenizers for Image Generation Conditional 15 image generation with pixelcnn decoders

Reference 78

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.301488Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:a930b4872c1dd6504e939daaf442534416040141c58adf18ead25df6cac5a8c7

Observation 0eac972c-3aed-4f66-9646-7ab550a8fd74 · outbound

This paper cites Neural discrete representation learning.

Vision Foundation Models as Generalist Tokenizers for Image Generation Neural discrete representation learning

Reference 79

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.324322Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:bcfaeb0e97a0947ec03ba36637a6d122385be7adfa4adc73e2a65ec36f38ca37

Observation 44d42f76-37e2-4ac2-8f12-91e3dba13773 · outbound

This paper cites Stacked denoising autoencoders: Learning useful representations in a deep network with a local denoising criterion.

Vision Foundation Models as Generalist Tokenizers for Image Generation Stacked denoising autoencoders: Learning useful representations in a deep network with a local denoising criterion

Reference 80

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.393352Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:9136b8e46cb8addc274d9beff0da57bdffb6957d6f518a3447c8a0b39d3e1e4e

Observation 9687e62e-6039-45ed-8208-77a743a3694c · outbound

This paper cites DDT: Decoupled Diffusion Transformer.

Vision Foundation Models as Generalist Tokenizers for Image Generation DDT: Decoupled Diffusion Transformer

Reference 81

Resolution
verified exact
arxiv_id, observed 2026-05-20T11:03:13.550688Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:be9bff7f1dbba9c50158bf0bf0b9fe473bb18afb4c7c6114972b522d4cfb6f4d

Observation 002edb18-0621-4af6-8e8b-d724b4c6b2f1 · outbound

This paper cites Image quality assessment: from error visibility to structural similarity.

Vision Foundation Models as Generalist Tokenizers for Image Generation Image quality assessment: from error visibility to structural similarity

Reference 82

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.283521Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:280c87ae7e24ea1447e6d49255a0f6d96dbdad8d790c60730cbe0e2217fccfff

Observation 4425373c-e46b-4ac9-95ca-178df2ce92c3 · outbound

This paper cites "Principal Components" Enable A New Language of Images.

Vision Foundation Models as Generalist Tokenizers for Image Generation "Principal Components" Enable A New Language of Images

Reference 83

Resolution
verified exact
arxiv_id, observed 2026-05-20T11:03:13.555929Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:ee7487465e54a08b1ff8555f6b52fd8cacad887dd8bd81e9eb57ab514e96b37b

Observation d9679bc2-2704-4bca-ae8e-297e3a91043f · outbound

This paper cites Show-o: One Single Transformer to Unify Multimodal Understanding and Generation.

Vision Foundation Models as Generalist Tokenizers for Image Generation Show-o: One Single Transformer to Unify Multimodal Understanding and Generation

Reference 84

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.496321Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:5e880f579772a65035bc9eabe674a0ea81b0de85a0bb18b8b65a80a265a42e28

Observation 883240f2-704e-47e5-a3a7-90a814ab2cec · outbound

This paper cites Gigatok: Scaling visual tokenizers to 3 billion param- eters for autoregressive image generation.

Vision Foundation Models as Generalist Tokenizers for Image Generation Gigatok: Scaling visual tokenizers to 3 billion param- eters for autoregressive image generation

Reference 85

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.326472Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:c0b3d45eb0a2b1d72b9619053fb81a8879eef39fc92eb981087cc0d97ce572e7

Observation 6e6f928f-0a8b-4c01-bfd3-f99235afa6cb · outbound

This paper cites Fasterdit: Towards faster diffusion transformers training with- out architecture modification.

Vision Foundation Models as Generalist Tokenizers for Image Generation Fasterdit: Towards faster diffusion transformers training with- out architecture modification

Reference 86

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.315138Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:ab93032724f541a333149397f6975e50da8529370b9c4c3061826f150b1006fb

Observation 578ff45d-f513-48ad-aa24-688b1b80a3d8 · outbound

This paper cites Reconstruction vs.

Vision Foundation Models as Generalist Tokenizers for Image Generation Reconstruction vs

Reference 87

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.287261Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:b2146ee25025ff5ef0c383b7d3908cb6ce4681469d26890b561f8d0c96886ebc

Observation 9f53fd8b-a68e-41da-ab0b-ec1eccde035d · outbound

This paper cites Vector-quantized Image Modeling with Improved VQGAN.

Vision Foundation Models as Generalist Tokenizers for Image Generation Vector-quantized Image Modeling with Improved VQGAN

Reference 88

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.458098Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:e534f866f5945960b807d04550ea270515b5fb1e849342108bf898a758e75b77

Observation 96c3b084-3c8b-484b-8aa4-572b660b0c83 · outbound

This paper cites Scaling autoregressive models for content-rich text-to-image generation.

Vision Foundation Models as Generalist Tokenizers for Image Generation Scaling autoregressive models for content-rich text-to-image generation

Reference 89

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.333772Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:03feb32936fe79d2f0751f480b4e8163693c30c6a4bbd1717857fe0001ff70f8

Observation 9915826e-ee5a-43c4-91d0-4356c29ed97c · outbound

This paper cites Hauptmann, Ming-Hsuan Yang, Yuan Hao, Irfan Essa, and Lu Jiang.

Vision Foundation Models as Generalist Tokenizers for Image Generation Hauptmann, Ming-Hsuan Yang, Yuan Hao, Irfan Essa, and Lu Jiang

Reference 90

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.298985Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:dab867faf299983f0b270d8049a873567384145e30308d2e4d916bc4414cfc1e

Observation e695229d-c8f4-48b9-a5e4-59aa7f00e9d9 · outbound

This paper cites Randomized autoregressive visual generation.

Vision Foundation Models as Generalist Tokenizers for Image Generation Randomized autoregressive visual generation

Reference 91

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.356374Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:3e329649275f864cf6e0182cc4c34fd9d48a6494fb9e8b181e3b372124a35351

Observation df817617-febd-48ed-9a38-f9ca51fe0792 · outbound

This paper cites An Image is Worth 32 Tokens for Reconstruction and Generation.

Vision Foundation Models as Generalist Tokenizers for Image Generation An Image is Worth 32 Tokens for Reconstruction and Generation

Reference 92

Resolution
metadata mismatch
arxiv_id, observed 2026-05-20T11:03:13.487184Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:85ced9e8f9c46abf1d320423862990e635c9d9b57529de02bb8276bc89bf4240

Observation f16ad447-eab2-429d-b721-9d57f3d2e685 · outbound

This paper cites Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think.

Vision Foundation Models as Generalist Tokenizers for Image Generation Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think

Reference 93

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.466288Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:8e47fcc84d308c54ea68e2c7cb11e6f95a75649a4dd70d2bb0967c6bb0303494

Observation b6592722-2279-4413-98d5-201a1398e249 · outbound

This paper cites Sigmoid loss for language image pre-training.

Vision Foundation Models as Generalist Tokenizers for Image Generation Sigmoid loss for language image pre-training

Reference 94

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.310543Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:d3502e3b5a8430b49a05d84f22e339bae8923aeaf10ef74048b5720cb758c8f6

Observation d91df3cb-cce2-4775-9bed-e52ddb214be8 · outbound

This paper cites The unreasonable effectiveness of deep features as a perceptual metric.

Vision Foundation Models as Generalist Tokenizers for Image Generation The unreasonable effectiveness of deep features as a perceptual metric

Reference 95

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.342145Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:9d232fae1977a6730e12101f018e546c33613f59500c739db515fb6906875f09

Observation c2180349-ac9d-45af-88c5-48f7968560c0 · outbound

This paper cites Holistic tokenizer for autoregressive image generation.

Vision Foundation Models as Generalist Tokenizers for Image Generation Holistic tokenizer for autoregressive image generation

Reference 96

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.358669Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:0737903c9463774483dbd9eac50ce3ed0834f16dd3f9731d5cd98fd1b0d67523

Observation 5f27f037-a6bf-41ad-ae26-5f5442484552 · outbound

This paper cites arXiv preprint arXiv:2507.08441 , year=.

Vision Foundation Models as Generalist Tokenizers for Image Generation arXiv preprint arXiv:2507.08441 , year=

Reference 97

Resolution
metadata mismatch
arxiv_id, observed 2026-05-20T11:03:13.469337Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:a8f9b2d0313ef89fbf2ff61a12e4a930dd8edafb3436f2543c3642f4ed553b15

Observation f40168af-01ef-4c09-9325-62c5c106458f · outbound

This paper cites Diffusion Transformers with Representation Autoencoders.

Vision Foundation Models as Generalist Tokenizers for Image Generation Diffusion Transformers with Representation Autoencoders

Reference 98

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.553297Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:c019ee4f2ccec18fcfb9ef5684fd6a9bbb23dfcfbb61c3925af0fcefa34734bc

Observation 764c9b29-8e43-4f63-b9c6-4cd0fe1d0125 · outbound

This paper cites Movq: Modulating quantized vectors for high-fidelity image generation.

Vision Foundation Models as Generalist Tokenizers for Image Generation Movq: Modulating quantized vectors for high-fidelity image generation

Reference 99

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.306135Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:3136b6c3cbe2c990352c2eb6103115784b91dbf303286a9a010f7acc6a29916c

Observation 07539e4e-6a3f-4ae2-ae0c-00fbec1cf69b · outbound

This paper cites Fast Training of Diffusion Models with Masked Transformers.

Vision Foundation Models as Generalist Tokenizers for Image Generation Fast Training of Diffusion Models with Masked Transformers

Reference 100

Resolution
metadata mismatch
arxiv_id, observed 2026-05-20T11:03:13.472208Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:0fe7690f57c545929e4ad3092d0f37f797cba7eb293d47a49de30b9def41f115

Observation 985670ae-37ab-402a-a5c9-6117c06516b1 · outbound

This paper cites ibot: Image bert pre-training with online tokenizer.

Vision Foundation Models as Generalist Tokenizers for Image Generation ibot: Image bert pre-training with online tokenizer

Reference 101

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.383587Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:8d723cd5659283f2097ef5eef3180c93442682b7fe6131535abd55c62b9a6c4f

Pith citing papers

Observation cc960685-3011-4161-b367-c7aa67f85770 · inbound

DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models cites this paper.

DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models Vision Foundation Models as Generalist Tokenizers for Image Generation

Reference 58

Resolution
metadata mismatch
local_arxiv, observed 2026-07-10T07:36:58.010915Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-07-10T07:31:26.225257Z digest=sha256:f38ac61b28aa236e66401d531aa3529ca73982a821ab8e6485fc904f932967bc