Pith. sign in

Paper Citation Record · LEDGER

Vision Foundation Models as Generalist Tokenizers for Image Generation

As of 18 August 2026, this Paper Citation Record lists 100 of 104 outbound references and 1 inbound Pith citation observation for arXiv:2605.18390.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2605.18390 v1

Coverage vector

measured 100 of 104 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-05-20T11:01:24.738195Z

measured 101 of 101 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-18T06:34:40.430872+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-07-10T07:31:26.225257Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-07-10T07:36:58.009410Z

Reference resolution

100 of 104 outbound references displayed

  • verified exact38
  • verified fuzzy56
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch6

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 4e9bae38-76a3-4f26-b64d-6a8f9dc687b5 · outbound

This paper cites Building Normalizing Flows with Stochastic Interpolants.

Vision Foundation Models as Generalist Tokenizers for Image Generation Building Normalizing Flows with Stochastic Interpolants

Reference 1

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.434134Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:eb046f80ccaf7d5119f1ca9728b04a4149a1fae45e594690e3f622c4a51768b0

Observation 9ae82e62-88a1-428b-a51c-052472268aac · outbound

This paper cites FlexTok: Resampling Images into 1D Token Sequences of Flexible Length.

Vision Foundation Models as Generalist Tokenizers for Image Generation FlexTok: Resampling Images into 1D Token Sequences of Flexible Length

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-05-20T11:03:13.436862Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:af015db01fb0700fff6df1f0d59881496992cfb43a59d0ccf23f3de3c4484b2e

Observation c661347a-3350-49e0-91cf-d1b0c1dadefb · outbound

This paper cites Autoencoders.

Vision Foundation Models as Generalist Tokenizers for Image Generation Autoencoders

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.293257Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:dfbabd721c3d9ac68b20d546673ca13e4c5a7d7e806a77021e170a5752c9c092

Observation 2e79dfd9-c309-4ec6-a2c8-d2073b2c8f41 · outbound

This paper cites Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation.

Vision Foundation Models as Generalist Tokenizers for Image Generation Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation

Reference 4

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.419677Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:baa3093c3b5921bc18aaddf80ff525a39f6abec72603677454e6ab031a81d5e2

Observation 64ab607e-1f3c-4490-87e5-35bf5614a5aa · outbound

This paper cites VFM-VAE: Vision Foundation Models Can Be Good Tokenizers for Latent Diffusion Models.

Vision Foundation Models as Generalist Tokenizers for Image Generation VFM-VAE: Vision Foundation Models Can Be Good Tokenizers for Latent Diffusion Models

Reference 5

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.509258Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:32ba17d1ce1251ff6e06dfebd8198c4c0a2b7ef8de95458b4965117d2ac81216

Observation 0e330b87-a4c2-4292-8f06-e354d8e348be · outbound

This paper cites Understanding disentangling in $\beta$-VAE.

Vision Foundation Models as Generalist Tokenizers for Image Generation Understanding disentangling in $\beta$-VAE

Reference 6

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.499461Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:811395c6ae6bb2b1d1d38398c60785ec0ea8a1b14869488f00a027c1bd4740b0

Observation 6531e696-8726-40cd-bc48-12cb9c65919e · outbound

This paper cites Emerging proper- ties in self-supervised vision transformers.

Vision Foundation Models as Generalist Tokenizers for Image Generation Emerging proper- ties in self-supervised vision transformers

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:14.381692Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:7fc0c93b49f87d460a593b4afdb2b667364a08e6d15f9ce47d64f6ce25fcfbf0

Observation 577fd82e-2723-4dcc-9376-5c734c9ba9f1 · outbound

This paper cites Maskgit: Masked generative image transformer.

Vision Foundation Models as Generalist Tokenizers for Image Generation Maskgit: Masked generative image transformer

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.369006Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:e4c444e99a50bf0047a74451fb93d5682b3ae3ca9a4f7d2672fafc40cb5c2c88

Observation 7f62fa5b-83c5-4d07-abe2-462a66b270e9 · outbound

This paper cites arXiv preprint arXiv:2509.25162 (2025) 4.

Vision Foundation Models as Generalist Tokenizers for Image Generation arXiv preprint arXiv:2509.25162 (2025) 4

Reference 9

Resolution
metadata mismatch
arxiv_id, observed 2026-05-20T11:03:13.446398Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:8c3595aff3be888add2ae49c1bbb5f1ed7697972773aa15e005033cd7be9342e

Observation 86b6e111-fbb5-4e10-820e-31a75b6bc23b · outbound

This paper cites Generative pretraining from pixels.

Vision Foundation Models as Generalist Tokenizers for Image Generation Generative pretraining from pixels

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.361169Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:e0b83940d3189eb7255b737080a4c84dd4008d607039de99a92c5a5c914effcb

Observation ff4ac094-3b5e-49b8-8662-4d07118b6c23 · outbound

This paper cites Improved Baselines with Momentum Contrastive Learning.

Vision Foundation Models as Generalist Tokenizers for Image Generation Improved Baselines with Momentum Contrastive Learning

Reference 11

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.536627Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:6ab356c6fe3d4c74de4f0d59b85b3b5be8f7b5db4cbc56d38b2af3734de55198

Observation 3d8dbb5b-cc5f-4de4-8bf1-fdf35db38174 · outbound

This paper cites Detection in crowded scenes: One proposal, multiple predictions.

Vision Foundation Models as Generalist Tokenizers for Image Generation Detection in crowded scenes: One proposal, multiple predictions

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.331216Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:7405922379b90f008bffd5fa855b0433e413fa82268e3f10f5741819a7a95efa

Observation e26eeeb9-6e02-437e-ac6d-78c6afd63313 · outbound

This paper cites Deformable convolutional networks.

Vision Foundation Models as Generalist Tokenizers for Image Generation Deformable convolutional networks

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:14.390167Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:c8a4a5454d6beba4dac36f6abb44a12457a2ecb9f8e3f76b4607832ae75dd4f0

Observation b9bfbb4f-1db2-49bd-9bbc-7ca5cd2704d4 · outbound

This paper cites Vision Transformers Need Registers.

Vision Foundation Models as Generalist Tokenizers for Image Generation Vision Transformers Need Registers

Reference 14

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.547925Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:d87664005e33adfacc6e4c5d69157c83e696784fde7b1fbae4105afe5e6a3201

Observation aeedf7ae-d146-4186-9207-db5d53c7a1ab · outbound

This paper cites Imagenet: A large-scale hierarchical image database.

Vision Foundation Models as Generalist Tokenizers for Image Generation Imagenet: A large-scale hierarchical image database

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.312779Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:e9226489605f6898739bb13d6b74d4cc00cf81e0bad5ca8e69cc36659bc08a12

Observation cf1cc1b3-746e-486f-a51d-46860a78ac60 · outbound

This paper cites Bert: Pre-training of deep bidirectional transform- ers for language understanding.

Vision Foundation Models as Generalist Tokenizers for Image Generation Bert: Pre-training of deep bidirectional transform- ers for language understanding

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:14.383783Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:c9009a60c9643f488a417a9a829ddf86f390dc0083198f81a30dbe89fa55bd0b

Observation fa51abb2-360b-4f8e-88ab-5d997fa4d3e5 · outbound

This paper cites Diffusion models beat gans on image synthesis.

Vision Foundation Models as Generalist Tokenizers for Image Generation Diffusion models beat gans on image synthesis

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.366414Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:dc7dedf08f1b9856bd075f42a2bce95b03046e42e51d7cb6c27767b9e20b6991

Observation 4fb7f249-21f0-464f-882c-6328b9301c73 · outbound

This paper cites An introduction to variational autoencoders.

Vision Foundation Models as Generalist Tokenizers for Image Generation An introduction to variational autoencoders

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:14.392237Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:28413d283acd8c122d6151c2d1dfdc466f76ed47b0cdfac9f538bfd4c1a6f61f

Observation 26638286-bf8c-4de3-9fe1-611ef3610a89 · outbound

This paper cites An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale.

Vision Foundation Models as Generalist Tokenizers for Image Generation An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale

Reference 19

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.518133Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:a6a247894c1e101e8a4946c2f684fb51b376232aedc3aed7d14e25ac9fa99726

Observation 2b4e0f94-ff25-42cb-a88a-fa90513818f2 · outbound

This paper cites Scaling rectified flow transformers for high- resolution image synthesis.

Vision Foundation Models as Generalist Tokenizers for Image Generation Scaling rectified flow transformers for high- resolution image synthesis

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.378602Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:2df363bd6c9108c645c72706918dc71f9b0418b4e41491894b6e4c2c7a0140b5

Observation 6abe7458-1044-4e66-bb07-dacdc7e82c62 · outbound

This paper cites Taming transformers for high-resolution image synthesis.

Vision Foundation Models as Generalist Tokenizers for Image Generation Taming transformers for high-resolution image synthesis

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:14.377192Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:dfcf0722469ae1cbca665658993d2505b34df5259ed4a8bceef6b73dc5fe35e5

Observation 1f77c73d-7e69-4ecc-83ed-81eda16fc45b · outbound

This paper cites One layer is enough: Adapting pretrained visual encoders for image generation.

Vision Foundation Models as Generalist Tokenizers for Image Generation One layer is enough: Adapting pretrained visual encoders for image generation

Reference 23

Resolution
verified exact
arxiv_id, observed 2026-05-20T11:03:13.478362Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:d8d1b2f09d479b88bd7479f95665f9ff6eb64b1a3baf344c6479b0b85cdb9b4f

Observation 8b4c9a63-dc23-436c-b93a-47a3c8d8824c · outbound

This paper cites Generative adversarial networks.

Vision Foundation Models as Generalist Tokenizers for Image Generation Generative adversarial networks

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.278967Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:dbd3111cddf310a0b550d3c14aa99971ea8638aee80fdf65165ba500e9623a4c

Observation 7ef378e6-3f7d-4a45-9540-4a2dc0c8e1a4 · outbound

This paper cites Bootstrap your own latent-a new approach to self-supervised learning.

Vision Foundation Models as Generalist Tokenizers for Image Generation Bootstrap your own latent-a new approach to self-supervised learning

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.376255Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:20db5122e643b7925904a13ad5db193db5be2acb0bf2519f6afc110b29224ab1

Observation a0bbab4b-173f-4e72-9dca-99de3929f7dc · outbound

This paper cites Learnings from Scaling Visual Tokenizers for Reconstruction and Generation.

Vision Foundation Models as Generalist Tokenizers for Image Generation Learnings from Scaling Visual Tokenizers for Reconstruction and Generation

Reference 26

Resolution
verified exact
arxiv_id, observed 2026-05-20T11:03:13.439682Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:769d5d54d8b388f80e6cb02269207bf3222c673211256fb38648634a12102660

Observation a16a26aa-333c-49e9-854b-f1be08784c49 · outbound

This paper cites Masked autoencoders are scalable vision learn- ers.

Vision Foundation Models as Generalist Tokenizers for Image Generation Masked autoencoders are scalable vision learn- ers

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.363974Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:3bb473e1fe9ae5e12dfa4baf7792215f6797a1edb46d983048b5aeb6ddb12a99

Observation e56fbd35-ca4f-4507-9bc9-783a3df32da7 · outbound

This paper cites Momentum Contrast for Unsupervised Visual Representation Learning.

Vision Foundation Models as Generalist Tokenizers for Image Generation Momentum Contrast for Unsupervised Visual Representation Learning

Reference 28

Resolution
verified exact
arxiv_id, observed 2026-05-20T11:03:13.423013Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:ff000b5fc9b56bdba20786dd6789118ee9a2b52f0004a04e35f014aa0a1b4bb4

Observation 019a7724-c873-49db-8112-7d6f1cf05ccf · outbound

This paper cites Deep residual learning for image recognition.

Vision Foundation Models as Generalist Tokenizers for Image Generation Deep residual learning for image recognition

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.349242Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:8d07fafa1974461cbbcab737c2a4e77f6b77560d0c40d4feae2ed5b418d56b63

Observation d90035ae-f1a2-4a67-92e1-67019c71184f · outbound

This paper cites Gans trained by a two time-scale update rule converge to a local nash equilibrium.

Vision Foundation Models as Generalist Tokenizers for Image Generation Gans trained by a two time-scale update rule converge to a local nash equilibrium

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.388477Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:407cc903c380db815ac24314b35ebea608955003ac3a7023f51fc1f8bd294e97

Observation 6e09baef-298c-4181-b4e9-5b6504b1ba1d · outbound

This paper cites Burgess, Xavier Glorot, Matthew M.

Vision Foundation Models as Generalist Tokenizers for Image Generation Burgess, Xavier Glorot, Matthew M

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.381015Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:dcd116a7eecd3590932f3ae723339437b5b18cb8320cbe3607a243addc919d36

Observation 0b37b325-454d-44e1-a563-a8013fd3d1d8 · outbound

This paper cites Denoising diffusion probabilistic models.

Vision Foundation Models as Generalist Tokenizers for Image Generation Denoising diffusion probabilistic models

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.303957Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:4563a07777ae6e5f224941d18241b9bac2c6a8b5b4dff0e047b1cdf95fc7e099

Observation f0585fe7-5767-4c77-b329-bd31a01ef568 · outbound

This paper cites Image-to-image translation with conditional adversarial networks.

Vision Foundation Models as Generalist Tokenizers for Image Generation Image-to-image translation with conditional adversarial networks

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.339587Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:b7320afde9efbf596bcfb85c88eab4ca0705445090ad674eba90dc67ea191f2f

Observation 4f8e6445-fe22-44e2-bc70-80fa8f60ab3d · outbound

This paper cites Image-to-image translation with conditional adversarial networks.

Vision Foundation Models as Generalist Tokenizers for Image Generation Image-to-image translation with conditional adversarial networks

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:14.386054Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:9cb6ec113c9f05ee99e88cffa3b5209b53bf1ee80ad3787229f24a38147fd88e

Observation 6045b28b-f457-4b1b-8ed7-45394e3763fd · outbound

This paper cites Scaling up visual and vision-language representation learning with noisy text supervision.

Vision Foundation Models as Generalist Tokenizers for Image Generation Scaling up visual and vision-language representation learning with noisy text supervision

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:14.394674Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:4797e0e74c9af8acecd0ee1ab640322a7150bc81115fdb37ddd4f9e3d6163d41

Observation e6f2b59b-2ad7-4f60-b5fe-c988e04c6c37 · outbound

This paper cites Guiding a diffusion model with a bad version of itself.

Vision Foundation Models as Generalist Tokenizers for Image Generation Guiding a diffusion model with a bad version of itself

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:14.388264Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:1b2ad52040d4907cb7b008f44387dc0ff125c3b7cbff1ca29de27da858e7db38

Observation 54e3dc9e-5f26-49ef-a986-f4649d371537 · outbound

This paper cites A style-based generator architecture for generative adversarial networks.

Vision Foundation Models as Generalist Tokenizers for Image Generation A style-based generator architecture for generative adversarial networks

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:14.379637Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:330b86a394ce8800070e0dee22c43c3dbf4bb31fe3fca2d29d5d9d0983b6a33b

Observation 4a9803c4-5bfe-4788-8ace-3196d619838b · outbound

This paper cites Auto-Encoding Variational Bayes.

Vision Foundation Models as Generalist Tokenizers for Image Generation Auto-Encoding Variational Bayes

Reference 38

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.492647Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:1ddab66b6858ef8f8dda594b73edcfab38131b5af505df6cfd9ca637cbdc4209

Observation c029ead1-642e-473d-8cc9-581b4d1971e7 · outbound

This paper cites EQ-VAE: Equivariance Regularized Latent Space for Improved Generative Image Modeling.

Vision Foundation Models as Generalist Tokenizers for Image Generation EQ-VAE: Equivariance Regularized Latent Space for Improved Generative Image Modeling

Reference 39

Resolution
verified exact
arxiv_id, observed 2026-05-20T11:03:13.461031Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:a087a99796dc94cb6a217a94d686401a1813e62348e0fabb00736c58a89bf032

Observation daf38ee2-127c-4aac-a920-8d83afc4b710 · outbound

This paper cites arXiv preprint arXiv:2504.16064 , year=.

Vision Foundation Models as Generalist Tokenizers for Image Generation arXiv preprint arXiv:2504.16064 , year=

Reference 40

Resolution
metadata mismatch
arxiv_id, observed 2026-05-20T11:03:13.528025Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:3c7b7634bdac4be2479bcfc43da68b5d414c73c762514d69762901cc5edbccaa

Observation 21c00f1e-307c-4e1f-900c-12ff3fa1da0e · outbound

This paper cites The open images dataset v4: Unified image classification, object detection, and visual relationship detection at scale.

Vision Foundation Models as Generalist Tokenizers for Image Generation The open images dataset v4: Unified image classification, object detection, and visual relationship detection at scale

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:14.375115Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:7d92aaccbaba4bc217632b1817da87da41bbc39a9efb58dbb8ee61ddfbbeae15

Observation 7df956ba-741f-44d6-9e2e-3a05b3bc4ab1 · outbound

This paper cites Improved precision and recall metric for assessing generative models.

Vision Foundation Models as Generalist Tokenizers for Image Generation Improved precision and recall metric for assessing generative models

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:14.370758Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:39e3d7f410d2a052cedd1563f0ab97ffc8822d572ca63836ade9982013d190e1

Observation 54a38ccd-6ccb-43d5-b38a-bca635aaeadd · outbound

This paper cites Autoregressive image generation using residual quantization.

Vision Foundation Models as Generalist Tokenizers for Image Generation Autoregressive image generation using residual quantization

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:14.372801Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:7fade1c2924f21489c9c2801ad3ca36cfa4fe44ccc8528fbb3a7a2b319a153b9

Observation 8943d534-2bfb-4ca8-a019-d727ef7a622c · outbound

This paper cites Repa-e: Unlocking vae for end-to-end tuning with latent diffusion transformers.

Vision Foundation Models as Generalist Tokenizers for Image Generation Repa-e: Unlocking vae for end-to-end tuning with latent diffusion transformers

Reference 44

Resolution
verified exact
arxiv_id, observed 2026-05-20T11:03:13.520976Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:cdd9301adf0b15ee9c29ee02df07f06c9bd29c05fab511bac73dedaeafe6e715

Observation dad91f52-f94d-41cf-9d64-0f721ae82904 · outbound

This paper cites Autoregressive Image Generation without Vector Quantization.

Vision Foundation Models as Generalist Tokenizers for Image Generation Autoregressive Image Generation without Vector Quantization

Reference 45

Resolution
verified exact
arxiv_id, observed 2026-05-20T11:03:13.515389Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:06fc6bd95ddebfb604b845cec220c6969dc1d4ddba6c1bc33e5f4e576f32d473

Observation 35a3c3f3-f2dc-45c9-a751-5897e4c373f8 · outbound

This paper cites ImageFolder: Autoregressive Image Generation with Folded Tokens.

Vision Foundation Models as Generalist Tokenizers for Image Generation ImageFolder: Autoregressive Image Generation with Folded Tokens

Reference 46

Resolution
verified exact
arxiv_id, observed 2026-05-20T11:03:13.505362Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:a4daf93be2e447037dc47a3f5f2e343da6c30a08537e1c65f6f83baa88854fb0

Observation 5acccd36-1bd9-4940-949d-0244ff1b5051 · outbound

This paper cites Feature pyramid networks for object detection.

Vision Foundation Models as Generalist Tokenizers for Image Generation Feature pyramid networks for object detection

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.319767Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:bfd436b87575d280a48785c49dba57c8691d5d6b086462899f5d4daa579992ea

Observation d5aae5c8-23ec-46d4-92e2-49c1d50c9d0a · outbound

This paper cites Focal loss for dense object detection.

Vision Foundation Models as Generalist Tokenizers for Image Generation Focal loss for dense object detection

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.371277Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:ef77e0eb6af4b69776864ebabf17cf56da3697fcb6dbf86f15664e72d7f1da9c

Observation 2a2f07b2-511f-4463-9d9b-f517be4a0f6a · outbound

This paper cites Flow Matching for Generative Modeling.

Vision Foundation Models as Generalist Tokenizers for Image Generation Flow Matching for Generative Modeling

Reference 49

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.474843Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:a52056ac0e86e9c5c089c266dcf5ea4b12e0a61a68edfcd378bce9f8cee93623

Observation 22c21af5-a7c8-4c39-86d7-17f6d34aa6f1 · outbound

This paper cites Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow.

Vision Foundation Models as Generalist Tokenizers for Image Generation Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow

Reference 50

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.452207Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:92c09e355d793947a498d8d95805cdbd62906e7e511014f64b8d446954afbb05

Observation 442793b9-5d8d-4c0b-a763-7028d8ec488a · outbound

This paper cites Decoupled Weight Decay Regularization.

Vision Foundation Models as Generalist Tokenizers for Image Generation Decoupled Weight Decay Regularization

Reference 51

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.442381Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:c1f110ccf1e1e9e8df1539f7de7ab823de5e88eb8d1428b2982a9b99132f4607

Observation 3ec1f911-62c2-4e81-9af7-34807fb6efb5 · outbound

This paper cites Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation.

Vision Foundation Models as Generalist Tokenizers for Image Generation Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation

Reference 52

Resolution
verified exact
arxiv_id, observed 2026-05-20T11:03:13.484061Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:6bb7e2b5b9fef61d6844267aa1007d3d1b8583156040805c1400c6c8df741a49

Observation ac649c53-4f79-42db-9414-97c75499300d · outbound

This paper cites Sit: Exploring flow and diffusion-based generative models with scalable interpolant transformers.

Vision Foundation Models as Generalist Tokenizers for Image Generation Sit: Exploring flow and diffusion-based generative models with scalable interpolant transformers

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.354139Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:f5a7b9f0b11dbf165dbaddf0956a04c71dedad18f8230f873ad92a3558d6ea43

Observation ea9248bc-495a-4754-86c0-9445a46f9fd5 · outbound

This paper cites Finite Scalar Quantization: VQ-VAE Made Simple.

Vision Foundation Models as Generalist Tokenizers for Image Generation Finite Scalar Quantization: VQ-VAE Made Simple

Reference 54

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.533895Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:15f0c20f271ec02d1ed79b70125e91281444ec54ea8bc939144e3779c562be19

Observation c1d8f6c1-2c4e-44db-917f-b19d81e6b7ca · outbound

This paper cites Conditional Generative Adversarial Nets.

Vision Foundation Models as Generalist Tokenizers for Image Generation Conditional Generative Adversarial Nets

Reference 55

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.463672Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:4632ac0e7803392d0cbed73d42f9c111af2bb457adc17fbaa2b2abca258f9f5c

Observation 28ed9a64-345d-4177-b51e-004c01d54576 · outbound

This paper cites One-D-Piece: Image Tokenizer Meets Quality-Controllable Compression.

Vision Foundation Models as Generalist Tokenizers for Image Generation One-D-Piece: Image Tokenizer Meets Quality-Controllable Compression

Reference 56

Resolution
verified exact
arxiv_id, observed 2026-05-20T11:03:13.539717Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:af655d137845882cf5bd8b4eae4221e9c208db4778f64f83473c6c779de5525f

Observation 679b6030-91bb-4466-b6d5-635efde81828 · outbound

This paper cites Improved denois- ing diffusion probabilistic models.

Vision Foundation Models as Generalist Tokenizers for Image Generation Improved denois- ing diffusion probabilistic models

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.290062Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:3c4173c2ef340ca5366a45f764f0a6609397c569b52a2f91a7e6721dcd42e03f

Observation 482d5ab3-81ca-4b87-871b-1a90bc3555b4 · outbound

This paper cites DINOv2: Learning Robust Visual Features without Supervision.

Vision Foundation Models as Generalist Tokenizers for Image Generation DINOv2: Learning Robust Visual Features without Supervision

Reference 58

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.545158Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:39a12dab553fdaaae93b9a06369b2bbab1a0c7e5e91d8b05b423ae40f0ededbf

Observation 03df1eec-62d9-4851-8293-a9205af759c1 · outbound

This paper cites Scalable diffusion models with transformers.

Vision Foundation Models as Generalist Tokenizers for Image Generation Scalable diffusion models with transformers

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.351517Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:c4d9401788c13a8d28d47e5da9113219c4a3f51df622879c785200820720f3bd

Observation ab1bc623-546d-41bc-9581-ddde19cc7ab6 · outbound

This paper cites TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation.

Vision Foundation Models as Generalist Tokenizers for Image Generation TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation

Reference 60

Resolution
verified exact
arxiv_id, observed 2026-05-20T11:03:13.455436Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:728c89ac865750c7b20bca7f4ee2634600b4e5c873dd443fe4ef4e55ae8106d8

Observation 706f594e-e853-4a1b-bbb9-1029e9398825 · outbound

This paper cites Learning transferable visual models from natural language super- vision.

Vision Foundation Models as Generalist Tokenizers for Image Generation Learning transferable visual models from natural language super- vision

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.308567Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:02581111a25557ca515bd42d2d9d03877340c44d00dc3c98ff98cc4cb72d1fba

Observation 5f3a9e1e-5e47-41bc-9b62-e5e1fca80fb7 · outbound

This paper cites Unsupervised Representation Learning with Deep Convolutional Generative Adversarial Networks.

Vision Foundation Models as Generalist Tokenizers for Image Generation Unsupervised Representation Learning with Deep Convolutional Generative Adversarial Networks

Reference 62

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.481008Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:a67d7ba5030549822651aa2c010d1f456bcc41c0db3fef60740af2e488e72e57

Observation a295e7ff-2403-452d-b365-6f7fe6d4121c · outbound

This paper cites Improving language understanding by generative pre-training.

Vision Foundation Models as Generalist Tokenizers for Image Generation Improving language understanding by generative pre-training

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.373837Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:a2c283d36e07f3c739106bd5bfa4d36831e778e82490c72d82282cb57bc8b4c5

Observation 41b546d7-5b6d-44bd-b9c1-a05bee75204c · outbound

This paper cites Generating diverse high-fidelity images with vq-vae-2.

Vision Foundation Models as Generalist Tokenizers for Image Generation Generating diverse high-fidelity images with vq-vae-2

Reference 64

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.386066Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:198ae3eed92a45318d35ff3d55167952ef3cd7bb50829e5282cd37c736afd7d9

Observation 3839fa64-2f4e-4618-85ef-7ee48050a721 · outbound

This paper cites High-resolution image synthesis with latent diffusion models.

Vision Foundation Models as Generalist Tokenizers for Image Generation High-resolution image synthesis with latent diffusion models

Reference 65

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.336515Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:2a35f1c910367694137db17b3283c7c484da33310c98a7ad961d8ca26cf4ef79

Observation 0148ab18-6fe6-454d-bc10-ca9f1d64189d · outbound

This paper cites Photorealistic text-to-image diffusion models with deep language understanding.

Vision Foundation Models as Generalist Tokenizers for Image Generation Photorealistic text-to-image diffusion models with deep language understanding

Reference 66

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.296277Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:02765f64d2552f7f2be1cb58e9ead563d1f84053d91b7a24f3259ee5857b46da

Observation 5b69732e-982d-40db-9847-e8e7ce214bfd · outbound

This paper cites Improved techniques for training gans.

Vision Foundation Models as Generalist Tokenizers for Image Generation Improved techniques for training gans

Reference 67

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.390939Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:2f1dc65ea1f253f7d9d28dec87ab8efd1a10fccdd190038bb3ee722a390472ff

Observation c79eb551-b8f4-470f-893d-aedf7ba3b0ca · outbound

This paper cites Improved techniques for training gans.

Vision Foundation Models as Generalist Tokenizers for Image Generation Improved techniques for training gans

Reference 68

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.347031Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:ad4b27d8ce63c70ed85c3b6788b499467ac14e6da36e8213e35d6ce4de8825a6

Observation 38afef1b-136f-48a9-b668-02f7675e4f8d · outbound

This paper cites Denoising Diffusion Implicit Models.

Vision Foundation Models as Generalist Tokenizers for Image Generation Denoising Diffusion Implicit Models

Reference 69

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.530872Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:34a320e805383cd7ee208a6b316a235aec900e6bc0784cdd324cd7a524ba341c

Observation d7ce9777-833b-4ecf-bce9-29c32b809eb1 · outbound

This paper cites DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies.

Vision Foundation Models as Generalist Tokenizers for Image Generation DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies

Reference 70

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.490028Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:17fedad84f429345eadb418504bd6fed9dd4287daae7610c8e51dcabfa6a0c3e

Observation 8a6cc765-4bf0-43bd-99e5-aabdf14ca6b0 · outbound

This paper cites Roformer: Enhanced transformer with rotary position embedding.

Vision Foundation Models as Generalist Tokenizers for Image Generation Roformer: Enhanced transformer with rotary position embedding

Reference 71

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.317427Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:0f5fa972dd3ff374f46fc0a9f299e831e283debaf61ead44a202da45eb60c916

Observation b5d0087d-6a23-48b5-8005-31327366d18d · outbound

This paper cites Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation.

Vision Foundation Models as Generalist Tokenizers for Image Generation Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation

Reference 72

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.502671Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:21046ff3167371012d75f5539efe8641410c60f76b6924b114faeb300f0e2866

Observation cea157d7-0fdc-4739-b4a2-12f7404084e4 · outbound

This paper cites Rethinking the inception architecture for computer vision.

Vision Foundation Models as Generalist Tokenizers for Image Generation Rethinking the inception architecture for computer vision

Reference 73

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.321992Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:56f6f776db20307cd714cf07f1a5e5a5f65246befd74943b09bd0b1fc0c63f51

Observation 78470744-c66c-40b4-af5c-a17b0d24c63b · outbound

This paper cites Unilip: Adapting clip for unified multimodal understanding, generation and editing.

Vision Foundation Models as Generalist Tokenizers for Image Generation Unilip: Adapting clip for unified multimodal understanding, generation and editing

Reference 74

Resolution
verified exact
arxiv_id, observed 2026-05-20T11:03:13.558830Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:59ad7f8dd6041312db1951dc09473dd52fa24cf3a555a91bdbb183eb12fc2d71

Observation 6a3834f3-bfc7-4c5b-bde3-a61da64e68a9 · outbound

This paper cites Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction.

Vision Foundation Models as Generalist Tokenizers for Image Generation Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction

Reference 75

Resolution
metadata mismatch
arxiv_id, observed 2026-05-20T11:03:13.431357Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:72023e4c65f3a4dde50aaf4e0983fa07ae71eac097be97143b5d7d1fda68cb23

Observation e31dac73-9b9c-4d41-ad24-aa928e3d3772 · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

Vision Foundation Models as Generalist Tokenizers for Image Generation LLaMA: Open and Efficient Foundation Language Models

Reference 76

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.542703Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:620063165e45d5cecdb802cd6ec5c92167180ba984e3249b0f9dea3eeb02a372

Observation 67f30945-4866-4694-97f0-29fd7f691ae1 · outbound

This paper cites SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features.

Vision Foundation Models as Generalist Tokenizers for Image Generation SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features

Reference 77

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.512117Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:4637ed136f86487580037cbee46e9f22abd687efda1bc010d72d61f31271667c

Observation 11e29742-d5f7-4b76-9def-091f416dd664 · outbound

This paper cites Conditional 15 image generation with pixelcnn decoders.

Vision Foundation Models as Generalist Tokenizers for Image Generation Conditional 15 image generation with pixelcnn decoders

Reference 78

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.301488Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:d7fbc8d084ec6527d91adaf645c361d33a4b360c2c1d65cf59fc049d5195fd85

Observation 0eac972c-3aed-4f66-9646-7ab550a8fd74 · outbound

This paper cites Neural discrete representation learning.

Vision Foundation Models as Generalist Tokenizers for Image Generation Neural discrete representation learning

Reference 79

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.324322Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:900ab3f13e2a8a48967febdf7b7df635766479e615b8144b33f0eee57e535aa3

Observation 44d42f76-37e2-4ac2-8f12-91e3dba13773 · outbound

This paper cites Stacked denoising autoencoders: Learning useful representations in a deep network with a local denoising criterion.

Vision Foundation Models as Generalist Tokenizers for Image Generation Stacked denoising autoencoders: Learning useful representations in a deep network with a local denoising criterion

Reference 80

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.393352Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:6d51332afe4dc0a80a1e0eb1bc42a18a5e4039bc2906bc62280048c05d967222

Observation 9687e62e-6039-45ed-8208-77a743a3694c · outbound

This paper cites DDT: Decoupled Diffusion Transformer.

Vision Foundation Models as Generalist Tokenizers for Image Generation DDT: Decoupled Diffusion Transformer

Reference 81

Resolution
verified exact
arxiv_id, observed 2026-05-20T11:03:13.550688Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:80bb685671978b4d872da74692fb36dc7d39cea14657eb1e00ab6e298d075cf2

Observation 002edb18-0621-4af6-8e8b-d724b4c6b2f1 · outbound

This paper cites Image quality assessment: from error visibility to structural similarity.

Vision Foundation Models as Generalist Tokenizers for Image Generation Image quality assessment: from error visibility to structural similarity

Reference 82

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.283521Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:fbd5d16287b94f52dde718208296c53e1a2030a2d52e077e9d60e5801c381ac2

Observation 4425373c-e46b-4ac9-95ca-178df2ce92c3 · outbound

This paper cites "Principal Components" Enable A New Language of Images.

Vision Foundation Models as Generalist Tokenizers for Image Generation "Principal Components" Enable A New Language of Images

Reference 83

Resolution
verified exact
arxiv_id, observed 2026-05-20T11:03:13.555929Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:ab2ea30c2d66718fdaf89c93fd1768bf8130859cb5425c1bd70a59c5134b8888

Observation d9679bc2-2704-4bca-ae8e-297e3a91043f · outbound

This paper cites Show-o: One Single Transformer to Unify Multimodal Understanding and Generation.

Vision Foundation Models as Generalist Tokenizers for Image Generation Show-o: One Single Transformer to Unify Multimodal Understanding and Generation

Reference 84

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.496321Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:96da9ff5e4afe6011f8510ba3af505aa726f5d0ceee30f22918f261e676d1fa5

Observation 883240f2-704e-47e5-a3a7-90a814ab2cec · outbound

This paper cites Gigatok: Scaling visual tokenizers to 3 billion param- eters for autoregressive image generation.

Vision Foundation Models as Generalist Tokenizers for Image Generation Gigatok: Scaling visual tokenizers to 3 billion param- eters for autoregressive image generation

Reference 85

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.326472Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:95906a52caf6cf10bf8328239dbb21eb8e8d463edb9476b98e9bbc7aa6d3cd82

Observation 6e6f928f-0a8b-4c01-bfd3-f99235afa6cb · outbound

This paper cites Fasterdit: Towards faster diffusion transformers training with- out architecture modification.

Vision Foundation Models as Generalist Tokenizers for Image Generation Fasterdit: Towards faster diffusion transformers training with- out architecture modification

Reference 86

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.315138Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:938cde9875a726cd70cd54df5efffd9ab5680e74371dc6ea33287d7d2aca489f

Observation 578ff45d-f513-48ad-aa24-688b1b80a3d8 · outbound

This paper cites Reconstruction vs.

Vision Foundation Models as Generalist Tokenizers for Image Generation Reconstruction vs

Reference 87

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.287261Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:e99315d0f97420a5c0895d674c17a6062f76a6ccfee271979aaaf4839064fc4d

Observation 9f53fd8b-a68e-41da-ab0b-ec1eccde035d · outbound

This paper cites Vector-quantized Image Modeling with Improved VQGAN.

Vision Foundation Models as Generalist Tokenizers for Image Generation Vector-quantized Image Modeling with Improved VQGAN

Reference 88

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.458098Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:7e8e419bde2f558d638e36e44054638ebb610b3a91239f67fcf058e7e233e3d6

Observation 96c3b084-3c8b-484b-8aa4-572b660b0c83 · outbound

This paper cites Scaling autoregressive models for content-rich text-to-image generation.

Vision Foundation Models as Generalist Tokenizers for Image Generation Scaling autoregressive models for content-rich text-to-image generation

Reference 89

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.333772Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:422d26d1ac171411700ef8ba97f8f0e744504f50fde0449c1b51bb2fec33e891

Observation 9915826e-ee5a-43c4-91d0-4356c29ed97c · outbound

This paper cites Hauptmann, Ming-Hsuan Yang, Yuan Hao, Irfan Essa, and Lu Jiang.

Vision Foundation Models as Generalist Tokenizers for Image Generation Hauptmann, Ming-Hsuan Yang, Yuan Hao, Irfan Essa, and Lu Jiang

Reference 90

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.298985Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:6ccf0de2dd0e245a285c4984737ccc0d70ffd5e2a3b70ce6013d92e47fb04cb5

Observation e695229d-c8f4-48b9-a5e4-59aa7f00e9d9 · outbound

This paper cites Randomized autoregressive visual generation.

Vision Foundation Models as Generalist Tokenizers for Image Generation Randomized autoregressive visual generation

Reference 91

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.356374Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:df89ef506e47feacf50ca0ab6d1791a182530083f9da2281d05e8a39780e8254

Observation df817617-febd-48ed-9a38-f9ca51fe0792 · outbound

This paper cites An Image is Worth 32 Tokens for Reconstruction and Generation.

Vision Foundation Models as Generalist Tokenizers for Image Generation An Image is Worth 32 Tokens for Reconstruction and Generation

Reference 92

Resolution
metadata mismatch
arxiv_id, observed 2026-05-20T11:03:13.487184Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:eff27dca1a757b824c0a03e28df71342bec892d9f11e65be679570020dd10c43

Observation f16ad447-eab2-429d-b721-9d57f3d2e685 · outbound

This paper cites Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think.

Vision Foundation Models as Generalist Tokenizers for Image Generation Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think

Reference 93

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.466288Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:3471e7e1411fb90a1a3ba065d36cb56fd6aa517a74e605c89ab8b3fe2395eb3d

Observation b6592722-2279-4413-98d5-201a1398e249 · outbound

This paper cites Sigmoid loss for language image pre-training.

Vision Foundation Models as Generalist Tokenizers for Image Generation Sigmoid loss for language image pre-training

Reference 94

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.310543Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:c14dcf3a7e063fe0eadd315d915b7f43908a8a00b6ac3bdbb9fcb7f38d2a85a1

Observation d91df3cb-cce2-4775-9bed-e52ddb214be8 · outbound

This paper cites The unreasonable effectiveness of deep features as a perceptual metric.

Vision Foundation Models as Generalist Tokenizers for Image Generation The unreasonable effectiveness of deep features as a perceptual metric

Reference 95

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.342145Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:378b6d8d46c8d00bdb34e577ba12731ea3ea4c670bbaf0c327c3800e50580360

Observation c2180349-ac9d-45af-88c5-48f7968560c0 · outbound

This paper cites Holistic tokenizer for autoregressive image generation.

Vision Foundation Models as Generalist Tokenizers for Image Generation Holistic tokenizer for autoregressive image generation

Reference 96

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.358669Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:5c6204298fd20deeb51f0ac9ba18fefc6305ef2cec4550faba6f9e3c628070e4

Observation 5f27f037-a6bf-41ad-ae26-5f5442484552 · outbound

This paper cites arXiv preprint arXiv:2507.08441 , year=.

Vision Foundation Models as Generalist Tokenizers for Image Generation arXiv preprint arXiv:2507.08441 , year=

Reference 97

Resolution
metadata mismatch
arxiv_id, observed 2026-05-20T11:03:13.469337Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:28b7239e8dd92eeb163613fa0e0b261cd1410319e2be4f0b39dfe5b3a8e530b9

Observation f40168af-01ef-4c09-9325-62c5c106458f · outbound

This paper cites Diffusion Transformers with Representation Autoencoders.

Vision Foundation Models as Generalist Tokenizers for Image Generation Diffusion Transformers with Representation Autoencoders

Reference 98

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.553297Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:30fc80406527f24fce32f65fa4885c9c3519a1f25135b03b1fd60cf07ad0d43a

Observation 764c9b29-8e43-4f63-b9c6-4cd0fe1d0125 · outbound

This paper cites Movq: Modulating quantized vectors for high-fidelity image generation.

Vision Foundation Models as Generalist Tokenizers for Image Generation Movq: Modulating quantized vectors for high-fidelity image generation

Reference 99

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.306135Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:9128f7ae932f5f5a72723866a83a158a2fc87f5bf686623394803cd46a41fd8f

Observation 07539e4e-6a3f-4ae2-ae0c-00fbec1cf69b · outbound

This paper cites Fast Training of Diffusion Models with Masked Transformers.

Vision Foundation Models as Generalist Tokenizers for Image Generation Fast Training of Diffusion Models with Masked Transformers

Reference 100

Resolution
metadata mismatch
arxiv_id, observed 2026-05-20T11:03:13.472208Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:36d881d9a9de6275e5f956bd7b84b0d854b89cf0f6b1d677f40d0363b5d68824

Observation 985670ae-37ab-402a-a5c9-6117c06516b1 · outbound

This paper cites ibot: Image bert pre-training with online tokenizer.

Vision Foundation Models as Generalist Tokenizers for Image Generation ibot: Image bert pre-training with online tokenizer

Reference 101

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T11:03:26.383587Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T11:01:24.738195Z digest=sha256:94dcb4bf60debff1b0f8cb174999ba0020f23965560d2b713452e69977e638f7

Pith citing papers

Observation cc960685-3011-4161-b367-c7aa67f85770 · inbound

DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models cites this paper.

DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models Vision Foundation Models as Generalist Tokenizers for Image Generation

Reference 58

Resolution
metadata mismatch
local_arxiv, observed 2026-07-10T07:36:58.010915Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-07-10T07:31:26.225257Z digest=sha256:dcbc6d11b1d00f03371a179c381ac0c64c9e81b12bcf267a7c971bddc77b27c0