{"as_of":"2026-08-18T06:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:42428dda082c3e7bdaeb704b97a6574946b2d5fed85a0171327550528543f5a6","coverage":[{"denominator":104,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T11:01:24.738195Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T07:31:26.225257Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T07:36:58.009410Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"cited_work":{"arxiv_id":"2605.18390","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.18390","snapshot_observed_at":"2026-07-10T07:36:58.009410Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","venue":"cs.CV","work_id":"35bc6597-4abc-46f4-98df-2c801ff2c1e1","year":2026},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-13T22:08:18.680686Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"cited_paper":"/paper/2605.18390","citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:dcbc6d11b1d00f03371a179c381ac0c64c9e81b12bcf267a7c971bddc77b27c0","observation_id":"cc960685-3011-4161-b367-c7aa67f85770","resolution":{"observed_at":"2026-07-10T07:36:58.010915Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2605.18390/citation-record","integrity":"/paper/2605.18390/integrity","json":"/paper/2605.18390/citation-record.json","paper":"/paper/2605.18390"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2209.15571","last_updated":"2023-03-09T15:18:40Z","snapshot_observed_at":"2026-08-14T22:23:53.150627Z","submitted_at":"2022-09-30T16:30:31Z","title":"Building Normalizing Flows with Stochastic Interpolants","version":3},"cited_work":{"arxiv_id":"2209.15571","doi":"10.1093/mnras/staf336","metadata_source":"pith","pith_arxiv_id":"2209.15571","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Building Normalizing Flows with Stochastic Interpolants","venue":"cs.LG","work_id":"83654cbd-832b-4269-bec9-26faa87ececd","year":2022},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/2209.15571","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:eb046f80ccaf7d5119f1ca9728b04a4149a1fae45e594690e3f622c4a51768b0","observation_id":"4e9bae38-76a3-4f26-b64d-6a8f9dc687b5","resolution":{"observed_at":"2026-05-20T11:03:13.434134Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-11T20:49:09.239152+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T20:49:09.239152+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13967","last_updated":"2025-06-04T12:56:23Z","snapshot_observed_at":"2026-08-16T20:33:32.731395Z","submitted_at":"2025-02-19T18:59:44Z","title":"FlexTok: Resampling Images into 1D Token Sequences of Flexible Length","version":2},"cited_work":{"arxiv_id":"2502.13967","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.13967","snapshot_observed_at":"2026-07-02T16:27:09.120633Z","title":"Flextok: Resampling images into 1d to- ken sequences of flexible length","venue":null,"work_id":"0196c4bc-6372-4122-adc3-afb6bbc6d7d0","year":2025},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/2502.13967","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:af015db01fb0700fff6df1f0d59881496992cfb43a59d0ccf23f3de3c4484b2e","observation_id":"9ae82e62-88a1-428b-a51c-052472268aac","resolution":{"observed_at":"2026-05-20T11:03:13.436862Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Autoencoders","venue":null,"work_id":"4d73ed56-2562-42a7-a531-1db1cd1f2f99","year":2023},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:dfbabd721c3d9ac68b20d546673ca13e4c5a7d7e806a77021e170a5752c9c092","observation_id":"c661347a-3350-49e0-91cf-d1b0c1dadefb","resolution":{"observed_at":"2026-05-20T11:03:26.293257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1308.3432","last_updated":"2013-08-15T15:19:34Z","snapshot_observed_at":"2026-08-14T04:51:04.817737Z","submitted_at":"2013-08-15T15:19:34Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","version":1},"cited_work":{"arxiv_id":"1308.3432","doi":"10.48550/arxiv.1308.3432","metadata_source":"pith","pith_arxiv_id":"1308.3432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","venue":"cs.LG","work_id":"1fe8c7c8-aff7-4b94-9096-e549d7e60789","year":2013},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/1308.3432","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:baa3093c3b5921bc18aaddf80ff525a39f6abec72603677454e6ab031a81d5e2","observation_id":"2e79dfd9-c309-4ec6-a2c8-d2073b2c8f41","resolution":{"observed_at":"2026-05-20T11:03:13.419677Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-05-19T16:22:27.235199+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T16:22:27.235199+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18457","last_updated":"2026-04-23T08:02:03Z","snapshot_observed_at":"2026-08-15T03:31:43.799649Z","submitted_at":"2025-10-21T09:30:45Z","title":"VFM-VAE: Vision Foundation Models Can Be Good Tokenizers for Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2510.18457","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.18457","snapshot_observed_at":"2026-07-07T15:43:53.837099Z","title":"VFM-VAE: Vision Foundation Models Can Be Good Tokenizers for Latent Diffusion Models","venue":"cs.CV","work_id":"ac74c8b6-a91c-4489-9fcd-ccb7356f4558","year":2025},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/2510.18457","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:32ba17d1ce1251ff6e06dfebd8198c4c0a2b7ef8de95458b4965117d2ac81216","observation_id":"64ab607e-1f3c-4490-87e5-35bf5614a5aa","resolution":{"observed_at":"2026-05-20T11:03:13.509258Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03599","last_updated":"2018-04-10T15:48:18Z","snapshot_observed_at":"2026-08-17T20:09:34.450047Z","submitted_at":"2018-04-10T15:48:18Z","title":"Understanding disentangling in $\\beta$-VAE","version":1},"cited_work":{"arxiv_id":"1804.03599","doi":null,"metadata_source":"pith","pith_arxiv_id":"1804.03599","snapshot_observed_at":"2026-07-07T18:04:00.565090Z","title":"Understanding disentangling in $\\beta$-VAE","venue":"stat.ML","work_id":"f6c67226-d4af-423d-9a12-877de69325da","year":2018},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/1804.03599","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:811395c6ae6bb2b1d1d38398c60785ec0ea8a1b14869488f00a027c1bd4740b0","observation_id":"0e330b87-a4c2-4292-8f06-e354d8e348be","resolution":{"observed_at":"2026-05-20T11:03:13.499461Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emerging proper- ties in self-supervised vision transformers","venue":null,"work_id":"d6b607e6-ae53-4f87-ad79-e42ad46478b1","year":2021},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:7fc0c93b49f87d460a593b4afdb2b667364a08e6d15f9ce47d64f6ce25fcfbf0","observation_id":"6531e696-8726-40cd-bc48-12cb9c65919e","resolution":{"observed_at":"2026-05-20T11:03:14.381692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Maskgit: Masked generative image transformer","venue":null,"work_id":"747f4130-330f-4630-947f-5fbb8b0972c6","year":2022},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:e4c444e99a50bf0047a74451fb93d5682b3ae3ca9a4f7d2672fafc40cb5c2c88","observation_id":"577fd82e-2723-4dcc-9376-5c734c9ba9f1","resolution":{"observed_at":"2026-05-20T11:03:26.369006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.25162","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:54.307986Z","title":"arXiv preprint arXiv:2509.25162 (2025) 4","venue":null,"work_id":"28315f59-d5f2-4386-b527-c6735b88b398","year":2025},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:8c3595aff3be888add2ae49c1bbb5f1ed7697972773aa15e005033cd7be9342e","observation_id":"7f62fa5b-83c5-4d07-abe2-462a66b270e9","resolution":{"observed_at":"2026-05-20T11:03:13.446398Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generative pretraining from pixels","venue":null,"work_id":"7a76b663-046d-4ff0-8fe7-0cd58efdb806","year":2020},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:e0b83940d3189eb7255b737080a4c84dd4008d607039de99a92c5a5c914effcb","observation_id":"86b6e111-fbb5-4e10-820e-31a75b6bc23b","resolution":{"observed_at":"2026-05-20T11:03:26.361169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.04297","last_updated":"2020-03-09T17:56:49Z","snapshot_observed_at":"2026-07-06T09:03:25.467987Z","submitted_at":"2020-03-09T17:56:49Z","title":"Improved Baselines with Momentum Contrastive Learning","version":1},"cited_work":{"arxiv_id":"2003.04297","doi":"10.48550/arxiv.2003.04297","metadata_source":"pith","pith_arxiv_id":"2003.04297","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improved Baselines with Momentum Contrastive Learning","venue":"cs.CV","work_id":"f275e715-bcdc-487c-bc31-6f98d8a01f5c","year":2020},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/2003.04297","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:6ab356c6fe3d4c74de4f0d59b85b3b5be8f7b5db4cbc56d38b2af3734de55198","observation_id":"ff4ac094-3b5e-49b8-8662-4d07118b6c23","resolution":{"observed_at":"2026-05-20T11:03:13.536627Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Detection in crowded scenes: One proposal, multiple predictions","venue":null,"work_id":"0a3c1ced-df9a-4845-8b4b-74946701a6a9","year":2020},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:7405922379b90f008bffd5fa855b0433e413fa82268e3f10f5741819a7a95efa","observation_id":"3d8dbb5b-cc5f-4de4-8bf1-fdf35db38174","resolution":{"observed_at":"2026-05-20T11:03:26.331216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deformable convolutional networks","venue":null,"work_id":"48160f25-6358-4255-8cdc-679808c8c0c5","year":2017},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:c8a4a5454d6beba4dac36f6abb44a12457a2ecb9f8e3f76b4607832ae75dd4f0","observation_id":"e26eeeb9-6e02-437e-ac6d-78c6afd63313","resolution":{"observed_at":"2026-05-20T11:03:14.390167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16588","last_updated":"2024-04-12T09:38:33Z","snapshot_observed_at":"2026-08-07T09:40:32.614733Z","submitted_at":"2023-09-28T16:45:46Z","title":"Vision Transformers Need Registers","version":2},"cited_work":{"arxiv_id":"2309.16588","doi":"10.48550/arxiv.2309.16588","metadata_source":"pith","pith_arxiv_id":"2309.16588","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision Transformers Need Registers","venue":"cs.CV","work_id":"57106da4-5420-4778-94eb-e821589aa7a0","year":2023},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/2309.16588","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:d87664005e33adfacc6e4c5d69157c83e696784fde7b1fbae4105afe5e6a3201","observation_id":"b9bfbb4f-1db2-49bd-9bbc-7ca5cd2704d4","resolution":{"observed_at":"2026-05-20T11:03:13.547925Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"0669c829-465c-4450-baff-6ddb1b8fe653","year":2009},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:e9226489605f6898739bb13d6b74d4cc00cf81e0bad5ca8e69cc36659bc08a12","observation_id":"aeedf7ae-d146-4186-9207-db5d53c7a1ab","resolution":{"observed_at":"2026-05-20T11:03:26.312779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bert: Pre-training of deep bidirectional transform- ers for language understanding","venue":null,"work_id":"ebaa1798-1368-462b-86b7-e0510738f35f","year":2019},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:c9009a60c9643f488a417a9a829ddf86f390dc0083198f81a30dbe89fa55bd0b","observation_id":"cf1cc1b3-746e-486f-a51d-46860a78ac60","resolution":{"observed_at":"2026-05-20T11:03:14.383783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":"24a6c62d-47bc-4975-9e4e-c1364bb6e7f0","year":2021},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:dc7dedf08f1b9856bd075f42a2bce95b03046e42e51d7cb6c27767b9e20b6991","observation_id":"fa51abb2-360b-4f8e-88ab-5d997fa4d3e5","resolution":{"observed_at":"2026-05-20T11:03:26.366414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An introduction to variational autoencoders","venue":null,"work_id":"a6dd2e17-85d5-4263-b862-af40a63ca920","year":2019},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:28413d283acd8c122d6151c2d1dfdc466f76ed47b0cdfac9f538bfd4c1a6f61f","observation_id":"4fb7f249-21f0-464f-882c-6328b9301c73","resolution":{"observed_at":"2026-05-20T11:03:14.392237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":"2010.11929","doi":"10.1175/jcli-d-22-0357.1","metadata_source":"pith","pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","venue":"cs.CV","work_id":"e96730e3-129b-4db6-b981-15ab7932e297","year":2020},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:a6a247894c1e101e8a4946c2f684fb51b376232aedc3aed7d14e25ac9fa99726","observation_id":"26638286-bf8c-4de3-9fe1-611ef3610a89","resolution":{"observed_at":"2026-05-20T11:03:13.518133Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling rectified flow transformers for high- resolution image synthesis","venue":null,"work_id":"29987b87-eab9-46b8-9df5-11d87c7daee1","year":2024},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:2df363bd6c9108c645c72706918dc71f9b0418b4e41491894b6e4c2c7a0140b5","observation_id":"2b4e0f94-ff25-42cb-a88a-fa90513818f2","resolution":{"observed_at":"2026-05-20T11:03:26.378602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":"e4f01f7a-3a55-4923-adea-ca31a959d8a7","year":2021},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:dfcf0722469ae1cbca665658993d2505b34df5259ed4a8bceef6b73dc5fe35e5","observation_id":"6abe7458-1044-4e66-bb07-dacdc7e82c62","resolution":{"observed_at":"2026-05-20T11:03:14.377192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.07829","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T15:43:53.790634Z","title":"One layer is enough: Adapting pretrained visual encoders for image generation","venue":null,"work_id":"c17af60a-6f9a-46c8-8b21-915407f8d12b","year":2025},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:d8d1b2f09d479b88bd7479f95665f9ff6eb64b1a3baf344c6479b0b85cdb9b4f","observation_id":"1f77c73d-7e69-4ecc-83ed-81eda16fc45b","resolution":{"observed_at":"2026-05-20T11:03:13.478362Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generative adversarial networks","venue":null,"work_id":"d16d06d1-808c-48b1-86fa-8473c884b579","year":2020},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:dbd3111cddf310a0b550d3c14aa99971ea8638aee80fdf65165ba500e9623a4c","observation_id":"8b4c9a63-dc23-436c-b93a-47a3c8d8824c","resolution":{"observed_at":"2026-05-20T11:03:26.278967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bootstrap your own latent-a new approach to self-supervised learning","venue":null,"work_id":"15780771-764e-4d8f-b920-ce252b40140b","year":2020},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:20db5122e643b7925904a13ad5db193db5be2acb0bf2519f6afc110b29224ab1","observation_id":"7ef378e6-3f7d-4a45-9540-4a2dc0c8e1a4","resolution":{"observed_at":"2026-05-20T11:03:26.376255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09755","last_updated":"2025-01-16T18:59:04Z","snapshot_observed_at":"2026-08-14T07:17:14.314435Z","submitted_at":"2025-01-16T18:59:04Z","title":"Learnings from Scaling Visual Tokenizers for Reconstruction and Generation","version":1},"cited_work":{"arxiv_id":"2501.09755","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.09755","snapshot_observed_at":"2026-07-07T15:43:53.781661Z","title":"Learnings from scaling visual tokenizers for reconstruction and generation","venue":"cs.CV","work_id":"b198a6f3-7796-4bb9-ab48-da1ef827995f","year":2025},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/2501.09755","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:769d5d54d8b388f80e6cb02269207bf3222c673211256fb38648634a12102660","observation_id":"a0bbab4b-173f-4e72-9dca-99de3929f7dc","resolution":{"observed_at":"2026-05-20T11:03:13.439682Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Masked autoencoders are scalable vision learn- ers","venue":null,"work_id":"93082754-3fc4-455b-a095-9fa4f9f28f62","year":2022},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:3bb473e1fe9ae5e12dfa4baf7792215f6797a1edb46d983048b5aeb6ddb12a99","observation_id":"a16a26aa-333c-49e9-854b-f1be08784c49","resolution":{"observed_at":"2026-05-20T11:03:26.363974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05722","last_updated":"2020-03-23T18:36:55Z","snapshot_observed_at":"2026-07-06T08:36:48.869880Z","submitted_at":"2019-11-13T18:53:26Z","title":"Momentum Contrast for Unsupervised Visual Representation Learning","version":3},"cited_work":{"arxiv_id":"1911.05722","doi":"10.48550/arxiv.1911.05722","metadata_source":"arxiv_reference","pith_arxiv_id":"1911.05722","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Momentum contrast for unsupervised visual representation learning","venue":"arXiv (Cornell University)","work_id":"7baa43ae-6df4-44d0-8bb0-138797a922b6","year":2020},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/1911.05722","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:ff000b5fc9b56bdba20786dd6789118ee9a2b52f0004a04e35f014aa0a1b4bb4","observation_id":"e56fbd35-ca4f-4507-9bc9-783a3df32da7","resolution":{"observed_at":"2026-05-20T11:03:13.423013Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"99f8c720-490e-42c7-aef5-243ce63f5406","year":2016},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:8d07fafa1974461cbbcab737c2a4e77f6b77560d0c40d4feae2ed5b418d56b63","observation_id":"019a7724-c873-49db-8112-7d6f1cf05ccf","resolution":{"observed_at":"2026-05-20T11:03:26.349242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":"3ff76f7b-d5f5-46c9-9fcf-8d8468a09374","year":2017},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:407cc903c380db815ac24314b35ebea608955003ac3a7023f51fc1f8bd294e97","observation_id":"d90035ae-f1a2-4a67-92e1-67019c71184f","resolution":{"observed_at":"2026-05-20T11:03:26.388477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Burgess, Xavier Glorot, Matthew M","venue":null,"work_id":"5592535e-5d4b-4f27-b6c8-35449d881a36","year":2016},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:dcd116a7eecd3590932f3ae723339437b5b18cb8320cbe3607a243addc919d36","observation_id":"6e09baef-298c-4181-b4e9-5b6504b1ba1d","resolution":{"observed_at":"2026-05-20T11:03:26.381015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"dcc30a7d-5df4-47a7-806b-168a1dc85cfb","year":2020},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:4563a07777ae6e5f224941d18241b9bac2c6a8b5b4dff0e047b1cdf95fc7e099","observation_id":"0b37b325-454d-44e1-a563-a8013fd3d1d8","resolution":{"observed_at":"2026-05-20T11:03:26.303957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Image-to-image translation with conditional adversarial networks","venue":null,"work_id":"1bc73a24-a607-4e3a-bbcf-8cc11f0c5673","year":2017},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:b7320afde9efbf596bcfb85c88eab4ca0705445090ad674eba90dc67ea191f2f","observation_id":"f0585fe7-5767-4c77-b329-bd31a01ef568","resolution":{"observed_at":"2026-05-20T11:03:26.339587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Image-to-image translation with conditional adversarial networks","venue":null,"work_id":"93b93923-f7b9-4d1b-9a61-a9833d3f51fc","year":2017},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:9cb6ec113c9f05ee99e88cffa3b5209b53bf1ee80ad3787229f24a38147fd88e","observation_id":"4f8e6445-fe22-44e2-bc70-80fa8f60ab3d","resolution":{"observed_at":"2026-05-20T11:03:14.386054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T15:02:40.750382Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":"99de536c-2c30-41fe-b0f9-77088fafbc80","year":2021},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:4797e0e74c9af8acecd0ee1ab640322a7150bc81115fdb37ddd4f9e3d6163d41","observation_id":"6045b28b-f457-4b1b-8ed7-45394e3763fd","resolution":{"observed_at":"2026-05-20T11:03:14.394674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Guiding a diffusion model with a bad version of itself","venue":null,"work_id":"223b50e0-ed12-4d15-8a80-8b001a2837da","year":2024},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:1b2ad52040d4907cb7b008f44387dc0ff125c3b7cbff1ca29de27da858e7db38","observation_id":"e6f2b59b-2ad7-4f60-b5fe-c988e04c6c37","resolution":{"observed_at":"2026-05-20T11:03:14.388264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A style-based generator architecture for generative adversarial networks","venue":null,"work_id":"38860227-2751-43b9-88e6-5def5cfcedde","year":2019},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:330b86a394ce8800070e0dee22c43c3dbf4bb31fe3fca2d29d5d9d0983b6a33b","observation_id":"54e3dc9e-5f26-49ef-a986-f4649d371537","resolution":{"observed_at":"2026-05-20T11:03:14.379637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":"1312.6114","doi":"10.2139/ssrn.4269703","metadata_source":"pith","pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Auto-Encoding Variational Bayes","venue":"stat.ML","work_id":"97d95295-30e1-42b4-bbf6-85f0fa4edb44","year":2013},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:1ddab66b6858ef8f8dda594b73edcfab38131b5af505df6cfd9ca637cbdc4209","observation_id":"4a9803c4-5bfe-4788-8ace-3196d619838b","resolution":{"observed_at":"2026-05-20T11:03:13.492647Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09509","last_updated":"2025-08-04T10:44:54Z","snapshot_observed_at":"2026-08-15T10:24:37.659346Z","submitted_at":"2025-02-13T17:21:51Z","title":"EQ-VAE: Equivariance Regularized Latent Space for Improved Generative Image Modeling","version":3},"cited_work":{"arxiv_id":"2502.09509","doi":"10.48550/arxiv.2502.09509","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09509","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Eq-vae: Equivariance regularized latent space for improved generative image modeling.arXiv preprint arXiv:2502.09509","venue":"ArXiv.org","work_id":"55928059-0cca-4d45-ad75-b255aa66f915","year":2025},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/2502.09509","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:a087a99796dc94cb6a217a94d686401a1813e62348e0fabb00736c58a89bf032","observation_id":"c029ead1-642e-473d-8cc9-581b4d1971e7","resolution":{"observed_at":"2026-05-20T11:03:13.461031Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.16064","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:59:58.139666Z","title":"arXiv preprint arXiv:2504.16064 , year=","venue":null,"work_id":"96b1bd59-9094-4c88-983d-a5d623fb5d28","year":2025},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:3c7b7634bdac4be2479bcfc43da68b5d414c73c762514d69762901cc5edbccaa","observation_id":"daf38ee2-127c-4aac-a920-8d83afc4b710","resolution":{"observed_at":"2026-05-20T11:03:13.528025Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The open images dataset v4: Unified image classification, object detection, and visual relationship detection at scale","venue":null,"work_id":"7c93321f-85a6-4913-9994-e3e639494308","year":1956},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:7d92aaccbaba4bc217632b1817da87da41bbc39a9efb58dbb8ee61ddfbbeae15","observation_id":"21c00f1e-307c-4e1f-900c-12ff3fa1da0e","resolution":{"observed_at":"2026-05-20T11:03:14.375115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved precision and recall metric for assessing generative models","venue":null,"work_id":"2b5e1cfd-5633-45ad-81a1-8fa830722a29","year":2019},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:39e3d7f410d2a052cedd1563f0ab97ffc8822d572ca63836ade9982013d190e1","observation_id":"7df956ba-741f-44d6-9e2e-3a05b3bc4ab1","resolution":{"observed_at":"2026-05-20T11:03:14.370758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Autoregressive image generation using residual quantization","venue":null,"work_id":"c3c4d8fc-fb5e-4f7b-9ad3-ad2d921f12cb","year":2022},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:7fade1c2924f21489c9c2801ad3ca36cfa4fe44ccc8528fbb3a7a2b319a153b9","observation_id":"54a38ccd-6ccb-43d5-b38a-bca635aaeadd","resolution":{"observed_at":"2026-05-20T11:03:14.372801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.10483","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:28:32.237292Z","title":"Repa-e: Unlocking vae for end-to-end tuning with latent diffusion transformers","venue":null,"work_id":"4ad471a0-3426-4e98-818c-cb238de280a9","year":2025},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:cdd9301adf0b15ee9c29ee02df07f06c9bd29c05fab511bac73dedaeafe6e715","observation_id":"8943d534-2bfb-4ca8-a019-d727ef7a622c","resolution":{"observed_at":"2026-05-20T11:03:13.520976Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11838","last_updated":"2024-11-01T14:45:36Z","snapshot_observed_at":"2026-08-16T13:42:07.461220Z","submitted_at":"2024-06-17T17:59:58Z","title":"Autoregressive Image Generation without Vector Quantization","version":3},"cited_work":{"arxiv_id":"2406.11838","doi":"10.48550/arxiv.2406.11838","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11838","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Autoregres- sive image generation without vector quantization.arXiv preprint arXiv:2406.11838","venue":"arXiv (Cornell University)","work_id":"154fdf62-5447-4dd1-bd62-d1188d2c4915","year":2024},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/2406.11838","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:06fc6bd95ddebfb604b845cec220c6969dc1d4ddba6c1bc33e5f4e576f32d473","observation_id":"dad91f52-f94d-41cf-9d64-0f721ae82904","resolution":{"observed_at":"2026-05-20T11:03:13.515389Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01756","last_updated":"2024-12-03T20:32:52Z","snapshot_observed_at":"2026-08-16T13:13:16.202764Z","submitted_at":"2024-10-02T17:06:39Z","title":"ImageFolder: Autoregressive Image Generation with Folded Tokens","version":3},"cited_work":{"arxiv_id":"2410.01756","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.01756","snapshot_observed_at":"2026-07-03T14:38:28.817961Z","title":"Imagefolder: Autoregres- sive image generation with folded tokens","venue":null,"work_id":"31c3d642-f3a7-4326-8674-523c08c24d7c","year":2024},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/2410.01756","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:a4daf93be2e447037dc47a3f5f2e343da6c30a08537e1c65f6f83baa88854fb0","observation_id":"35a3c3f3-f2dc-45c9-a751-5897e4c373f8","resolution":{"observed_at":"2026-05-20T11:03:13.505362Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Feature pyramid networks for object detection","venue":null,"work_id":"1f20c4a8-de05-436e-a7f2-2058be636d39","year":2017},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:bfd436b87575d280a48785c49dba57c8691d5d6b086462899f5d4daa579992ea","observation_id":"5acccd36-1bd9-4940-949d-0244ff1b5051","resolution":{"observed_at":"2026-05-20T11:03:26.319767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Focal loss for dense object detection","venue":null,"work_id":"c47fbeb0-c389-497f-9319-45e99b3848ca","year":2017},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:ef77e0eb6af4b69776864ebabf17cf56da3697fcb6dbf86f15664e72d7f1da9c","observation_id":"d5aae5c8-23ec-46d4-92e2-49c1d50c9d0a","resolution":{"observed_at":"2026-05-20T11:03:26.371277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-16T02:30:42.660030Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:a52056ac0e86e9c5c089c266dcf5ea4b12e0a61a68edfcd378bce9f8cee93623","observation_id":"2a2f07b2-511f-4463-9d9b-f517be4a0f6a","resolution":{"observed_at":"2026-05-20T11:03:13.474843Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":"2209.03003","doi":"10.48550/arxiv.2209.03003","metadata_source":"pith","pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","venue":"cs.LG","work_id":"a1989e1b-d66d-4533-be3a-fb9c5fd62290","year":2022},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:92c09e355d793947a498d8d95805cdbd62906e7e511014f64b8d446954afbb05","observation_id":"22c21af5-a7c8-4c39-86d7-17f6d34aa6f1","resolution":{"observed_at":"2026-05-20T11:03:13.452207Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-11T22:49:29.244251+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T22:49:29.244251+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:c1f110ccf1e1e9e8df1539f7de7ab823de5e88eb8d1428b2982a9b99132f4607","observation_id":"442793b9-5d8d-4c0b-a763-7028d8ec488a","resolution":{"observed_at":"2026-05-20T11:03:13.442381Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04410","last_updated":"2025-02-09T08:59:19Z","snapshot_observed_at":"2026-08-16T13:20:41.485941Z","submitted_at":"2024-09-06T17:14:53Z","title":"Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation","version":3},"cited_work":{"arxiv_id":"2409.04410","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.04410","snapshot_observed_at":"2026-07-04T13:09:50.831210Z","title":"Open-magvit2: An open-source project toward democratizing auto-regressive visual gener- ation","venue":null,"work_id":"a2523977-d17d-43e1-8c06-1f6ba1c28388","year":2025},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/2409.04410","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:6bb7e2b5b9fef61d6844267aa1007d3d1b8583156040805c1400c6c8df741a49","observation_id":"3ec1f911-62c2-4e81-9af7-34807fb6efb5","resolution":{"observed_at":"2026-05-20T11:03:13.484061Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:41.692083Z","title":"Sit: Exploring flow and diffusion-based generative models with scalable interpolant transformers","venue":null,"work_id":"a08d2a16-a0ba-4b60-afd1-b5ffb9f4de4f","year":2024},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:f5a7b9f0b11dbf165dbaddf0956a04c71dedad18f8230f873ad92a3558d6ea43","observation_id":"ac649c53-4f79-42db-9414-97c75499300d","resolution":{"observed_at":"2026-05-20T11:03:26.354139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-07-06T16:24:17.829828Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"cited_work":{"arxiv_id":"2309.15505","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15505","snapshot_observed_at":"2026-07-10T02:16:42.481403Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","venue":"cs.CV","work_id":"34dd22bc-0de9-4e11-9a1b-1358e10fbfe1","year":2023},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/2309.15505","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:15f0c20f271ec02d1ed79b70125e91281444ec54ea8bc939144e3779c562be19","observation_id":"ea9248bc-495a-4754-86c0-9445a46f9fd5","resolution":{"observed_at":"2026-05-20T11:03:13.533895Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1411.1784","last_updated":"2014-11-06T22:33:22Z","snapshot_observed_at":"2026-08-16T19:10:09.657437Z","submitted_at":"2014-11-06T22:33:22Z","title":"Conditional Generative Adversarial Nets","version":1},"cited_work":{"arxiv_id":"1411.1784","doi":"10.48550/arxiv.1411.1784","metadata_source":"pith","pith_arxiv_id":"1411.1784","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conditional Generative Adversarial Nets","venue":"cs.LG","work_id":"1d3bbf10-6268-4cc1-9702-27df9208c6af","year":2014},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/1411.1784","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:4632ac0e7803392d0cbed73d42f9c111af2bb457adc17fbaa2b2abca258f9f5c","observation_id":"c1d8f6c1-2c4e-44db-917f-b19d81e6b7ca","resolution":{"observed_at":"2026-05-20T11:03:13.463672Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10064","last_updated":"2025-01-17T09:29:33Z","snapshot_observed_at":"2026-08-13T17:02:34.924212Z","submitted_at":"2025-01-17T09:29:33Z","title":"One-D-Piece: Image Tokenizer Meets Quality-Controllable Compression","version":1},"cited_work":{"arxiv_id":"2501.10064","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.10064","snapshot_observed_at":"2026-07-04T17:40:01.064614Z","title":"One-d-piece: Image tokenizer meets quality- controllable compression","venue":null,"work_id":"1836059f-9b90-4a04-b98c-5a21264475bc","year":2025},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/2501.10064","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:af655d137845882cf5bd8b4eae4221e9c208db4778f64f83473c6c779de5525f","observation_id":"28ed9a64-345d-4177-b51e-004c01d54576","resolution":{"observed_at":"2026-05-20T11:03:13.539717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved denois- ing diffusion probabilistic models","venue":null,"work_id":"3db95769-246d-4ae8-a38e-a5a58653c2ea","year":2021},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:3c4173c2ef340ca5366a45f764f0a6609397c569b52a2f91a7e6721dcd42e03f","observation_id":"679b6030-91bb-4466-b6d5-635efde81828","resolution":{"observed_at":"2026-05-20T11:03:26.290062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:39a12dab553fdaaae93b9a06369b2bbab1a0c7e5e91d8b05b423ae40f0ededbf","observation_id":"482d5ab3-81ca-4b87-871b-1a90bc3555b4","resolution":{"observed_at":"2026-05-20T11:03:13.545158Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"42834237-2231-4eb6-9344-da600a2a604f","year":2023},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:c4d9401788c13a8d28d47e5da9113219c4a3f51df622879c785200820720f3bd","observation_id":"03df1eec-62d9-4851-8293-a9205af759c1","resolution":{"observed_at":"2026-05-20T11:03:26.351517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03069","last_updated":"2025-08-07T09:08:33Z","snapshot_observed_at":"2026-08-15T18:07:41.591747Z","submitted_at":"2024-12-04T06:46:55Z","title":"TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2412.03069","doi":"10.48550/arxiv.2412.03069","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.03069","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tokenflow: Unified image tokenizer for multimodal understanding and generation","venue":"arXiv (Cornell University)","work_id":"6a964215-761a-438d-b579-a2699f32913f","year":2024},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/2412.03069","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:728c89ac865750c7b20bca7f4ee2634600b4e5c873dd443fe4ef4e55ae8106d8","observation_id":"ab1bc623-546d-41bc-9581-ddde19cc7ab6","resolution":{"observed_at":"2026-05-20T11:03:13.455436Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural language super- vision","venue":null,"work_id":"c2e192bd-d78d-45d3-9d61-af3f38b3045b","year":2021},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:02581111a25557ca515bd42d2d9d03877340c44d00dc3c98ff98cc4cb72d1fba","observation_id":"706f594e-e853-4a1b-bbb9-1029e9398825","resolution":{"observed_at":"2026-05-20T11:03:26.308567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06434","last_updated":"2016-01-07T23:09:39Z","snapshot_observed_at":"2026-08-12T18:43:14.431633Z","submitted_at":"2015-11-19T22:50:32Z","title":"Unsupervised Representation Learning with Deep Convolutional Generative Adversarial Networks","version":2},"cited_work":{"arxiv_id":"1511.06434","doi":"10.48550/arxiv.1511.06434","metadata_source":"pith","pith_arxiv_id":"1511.06434","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Unsupervised Representation Learning with Deep Convolutional Generative Adversarial Networks","venue":"cs.LG","work_id":"fe2c86f4-daa0-4e36-b130-d09d98afa55a","year":2015},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/1511.06434","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:a67d7ba5030549822651aa2c010d1f456bcc41c0db3fef60740af2e488e72e57","observation_id":"5f3a9e1e-5e47-41bc-9b62-e5e1fca80fb7","resolution":{"observed_at":"2026-05-20T11:03:13.481008Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":"b4c79f09-f539-449b-8154-e3d82e3dc8f8","year":2018},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:a2c283d36e07f3c739106bd5bfa4d36831e778e82490c72d82282cb57bc8b4c5","observation_id":"a295e7ff-2403-452d-b365-6f7fe6d4121c","resolution":{"observed_at":"2026-05-20T11:03:26.373837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generating diverse high-fidelity images with vq-vae-2","venue":null,"work_id":"44e67947-ba9c-44a3-a8c9-210bda518807","year":2019},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:198ae3eed92a45318d35ff3d55167952ef3cd7bb50829e5282cd37c736afd7d9","observation_id":"41b546d7-5b6d-44bd-b9c1-a05bee75204c","resolution":{"observed_at":"2026-05-20T11:03:26.386066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:13:49.527710Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"2b98f07c-752a-416d-8817-b437ecac53f1","year":2021},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:2a35f1c910367694137db17b3283c7c484da33310c98a7ad961d8ca26cf4ef79","observation_id":"3839fa64-2f4e-4618-85ef-7ee48050a721","resolution":{"observed_at":"2026-05-20T11:03:26.336515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":"5b89bcca-4719-4bc9-866f-32ee5b5f4943","year":2022},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:02765f64d2552f7f2be1cb58e9ead563d1f84053d91b7a24f3259ee5857b46da","observation_id":"0148ab18-6fe6-454d-bc10-ca9f1d64189d","resolution":{"observed_at":"2026-05-20T11:03:26.296277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved techniques for training gans","venue":null,"work_id":"102d8e62-90e6-4386-a6c0-09d95ca8bc56","year":2016},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:2f1dc65ea1f253f7d9d28dec87ab8efd1a10fccdd190038bb3ee722a390472ff","observation_id":"5b69732e-982d-40db-9847-e8e7ce214bfd","resolution":{"observed_at":"2026-05-20T11:03:26.390939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved techniques for training gans","venue":null,"work_id":"b82d1b7e-518b-438d-89e8-b252f2c4738a","year":2016},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:ad4b27d8ce63c70ed85c3b6788b499467ac14e6da36e8213e35d6ce4de8825a6","observation_id":"c79eb551-b8f4-470f-893d-aedf7ba3b0ca","resolution":{"observed_at":"2026-05-20T11:03:26.347031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":"2010.02502","doi":"10.48550/arxiv.2010.02502","metadata_source":"pith","pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Denoising Diffusion Implicit Models","venue":"cs.LG","work_id":"8fa2128b-d18c-405c-ac92-0e669cf89ac0","year":2020},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:34a320e805383cd7ee208a6b316a235aec900e6bc0784cdd324cd7a524ba341c","observation_id":"38afef1b-136f-48a9-b668-02f7675e4f8d","resolution":{"observed_at":"2026-05-20T11:03:13.530872Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14324","last_updated":"2026-04-20T17:55:12Z","snapshot_observed_at":"2026-08-02T12:34:37.994590Z","submitted_at":"2025-03-18T14:56:46Z","title":"DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies","version":3},"cited_work":{"arxiv_id":"2503.14324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.14324","snapshot_observed_at":"2026-07-04T10:09:44.696076Z","title":"DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies","venue":"cs.CV","work_id":"b7011dfc-3583-42ce-94ec-4dc9a84c02df","year":2025},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/2503.14324","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:17fedad84f429345eadb418504bd6fed9dd4287daae7610c8e51dcabfa6a0c3e","observation_id":"d7ce9777-833b-4ecf-bce9-29c32b809eb1","resolution":{"observed_at":"2026-05-20T11:03:13.490028Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":"73ab2f58-5a1a-4c24-b31a-eb3c402222c9","year":2024},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:0f5fa972dd3ff374f46fc0a9f299e831e283debaf61ead44a202da45eb60c916","observation_id":"8a6cc765-4bf0-43bd-99e5-aabdf14ca6b0","resolution":{"observed_at":"2026-05-20T11:03:26.317427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-08-13T22:05:34.844117Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":"2406.06525","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-07-10T11:37:03.266757Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","venue":"cs.CV","work_id":"41efe203-9377-4c63-b1d6-e499cd6e46f6","year":2024},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:21046ff3167371012d75f5539efe8641410c60f76b6924b114faeb300f0e2866","observation_id":"b5d0087d-6a23-48b5-8005-31327366d18d","resolution":{"observed_at":"2026-05-20T11:03:13.502671Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rethinking the inception architecture for computer vision","venue":null,"work_id":"f6c91120-e74e-45ee-99eb-10989c847353","year":2016},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:56f6f776db20307cd714cf07f1a5e5a5f65246befd74943b09bd0b1fc0c63f51","observation_id":"cea157d7-0fdc-4739-b4a2-12f7404084e4","resolution":{"observed_at":"2026-05-20T11:03:26.321992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.23278","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:36:52.528059Z","title":"Unilip: Adapting clip for unified multimodal understanding, generation and editing","venue":null,"work_id":"a1bad6a0-54ce-45f8-8478-3169a4b3c6e8","year":2025},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:59ad7f8dd6041312db1951dc09473dd52fa24cf3a555a91bdbb183eb12fc2d71","observation_id":"78470744-c66c-40b4-af5c-a17b0d24c63b","resolution":{"observed_at":"2026-05-20T11:03:13.558830Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-08-16T14:03:52.109479Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:72023e4c65f3a4dde50aaf4e0983fa07ae71eac097be97143b5d7d1fda68cb23","observation_id":"6a3834f3-bfc7-4c5b-bde3-a61da64e68a9","resolution":{"observed_at":"2026-05-20T11:03:13.431357Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:620063165e45d5cecdb802cd6ec5c92167180ba984e3249b0f9dea3eeb02a372","observation_id":"e31dac73-9b9c-4d41-ad24-aa928e3d3772","resolution":{"observed_at":"2026-05-20T11:03:13.542703Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":"2502.14786","doi":"10.48550/arxiv.2502.14786","metadata_source":"pith","pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","venue":"cs.CV","work_id":"50eec732-2d41-432f-9dcf-ac7fff235ea5","year":2025},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:4637ed136f86487580037cbee46e9f22abd687efda1bc010d72d61f31271667c","observation_id":"67f30945-4866-4694-97f0-29fd7f691ae1","resolution":{"observed_at":"2026-05-20T11:03:13.512117Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conditional 15 image generation with pixelcnn decoders","venue":null,"work_id":"f8aef26a-4f24-401e-a4b4-2ab4dc0562aa","year":2016},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:d7fbc8d084ec6527d91adaf645c361d33a4b360c2c1d65cf59fc049d5195fd85","observation_id":"11e29742-d5f7-4b76-9def-091f416dd664","resolution":{"observed_at":"2026-05-20T11:03:26.301488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural discrete representation learning","venue":null,"work_id":"283b4f1c-9734-42bd-840f-0e1d4b646ec2","year":2017},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:900ab3f13e2a8a48967febdf7b7df635766479e615b8144b33f0eee57e535aa3","observation_id":"0eac972c-3aed-4f66-9646-7ab550a8fd74","resolution":{"observed_at":"2026-05-20T11:03:26.324322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stacked denoising autoencoders: Learning useful representations in a deep network with a local denoising criterion","venue":null,"work_id":"ec7f803d-d1fd-418d-8792-dd87736cc0dc","year":2010},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:6d51332afe4dc0a80a1e0eb1bc42a18a5e4039bc2906bc62280048c05d967222","observation_id":"44d42f76-37e2-4ac2-8f12-91e3dba13773","resolution":{"observed_at":"2026-05-20T11:03:26.393352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05741","last_updated":"2025-04-09T04:23:38Z","snapshot_observed_at":"2026-08-16T12:43:07.817483Z","submitted_at":"2025-04-08T07:17:45Z","title":"DDT: Decoupled Diffusion Transformer","version":2},"cited_work":{"arxiv_id":"2504.05741","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.05741","snapshot_observed_at":"2026-07-10T18:47:31.564501Z","title":"Ddt: Decoupled diffusion transformer","venue":"cs.CV","work_id":"8625279b-e85e-4c87-ba22-16d4d9e1f709","year":2025},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/2504.05741","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:80bb685671978b4d872da74692fb36dc7d39cea14657eb1e00ab6e298d075cf2","observation_id":"9687e62e-6039-45ed-8208-77a743a3694c","resolution":{"observed_at":"2026-05-20T11:03:13.550688Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:12:31.597233Z","title":"Image quality assessment: from error visibility to structural similarity","venue":null,"work_id":"053fa9ce-e4b2-41ad-89e6-20968dffe1db","year":2004},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:fbd5d16287b94f52dde718208296c53e1a2030a2d52e077e9d60e5801c381ac2","observation_id":"002edb18-0621-4af6-8e8b-d724b4c6b2f1","resolution":{"observed_at":"2026-05-20T11:03:26.283521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08685","last_updated":"2025-07-28T09:59:52Z","snapshot_observed_at":"2026-08-16T12:51:00.876826Z","submitted_at":"2025-03-11T17:59:41Z","title":"\"Principal Components\" Enable A New Language of Images","version":2},"cited_work":{"arxiv_id":"2503.08685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.08685","snapshot_observed_at":"2026-06-29T18:13:48.965421Z","title":"Principal components","venue":null,"work_id":"1cdb67b6-21f8-4d71-bf4d-79e7d603fa70","year":2025},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/2503.08685","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:ab2ea30c2d66718fdaf89c93fd1768bf8130859cb5425c1bd70a59c5134b8888","observation_id":"4425373c-e46b-4ac9-95ca-178df2ce92c3","resolution":{"observed_at":"2026-05-20T11:03:13.555929Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":"2408.12528","doi":"10.48550/arxiv.2408.12528","metadata_source":"pith","pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","venue":"cs.CV","work_id":"1393dc24-a6b2-44e1-b5d7-7009d1fa4811","year":2024},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:96da9ff5e4afe6011f8510ba3af505aa726f5d0ceee30f22918f261e676d1fa5","observation_id":"d9679bc2-2704-4bca-ae8e-297e3a91043f","resolution":{"observed_at":"2026-05-20T11:03:13.496321Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gigatok: Scaling visual tokenizers to 3 billion param- eters for autoregressive image generation","venue":null,"work_id":"d48c4ba9-2b10-4ba7-876f-b2926ddb6963","year":2025},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:95906a52caf6cf10bf8328239dbb21eb8e8d463edb9476b98e9bbc7aa6d3cd82","observation_id":"883240f2-704e-47e5-a3a7-90a814ab2cec","resolution":{"observed_at":"2026-05-20T11:03:26.326472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fasterdit: Towards faster diffusion transformers training with- out architecture modification","venue":null,"work_id":"0f391eb4-8143-4a1b-b139-9c5ec173dda7","year":2024},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:938cde9875a726cd70cd54df5efffd9ab5680e74371dc6ea33287d7d2aca489f","observation_id":"6e6f928f-0a8b-4c01-bfd3-f99235afa6cb","resolution":{"observed_at":"2026-05-20T11:03:26.315138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reconstruction vs","venue":null,"work_id":"befb57ad-0121-4d6c-bc69-63bacb4c2aeb","year":2025},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:e99315d0f97420a5c0895d674c17a6062f76a6ccfee271979aaaf4839064fc4d","observation_id":"578ff45d-f513-48ad-aa24-688b1b80a3d8","resolution":{"observed_at":"2026-05-20T11:03:26.287261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04627","last_updated":"2022-06-05T01:57:58Z","snapshot_observed_at":"2026-08-17T22:14:12.219954Z","submitted_at":"2021-10-09T18:36:00Z","title":"Vector-quantized Image Modeling with Improved VQGAN","version":3},"cited_work":{"arxiv_id":"2110.04627","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.04627","snapshot_observed_at":"2026-07-04T09:49:44.490632Z","title":"Vector-quantized Image Modeling with Improved VQGAN","venue":"cs.CV","work_id":"8ba56539-4766-42a4-868c-f9bef1281034","year":2021},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/2110.04627","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:7e8e419bde2f558d638e36e44054638ebb610b3a91239f67fcf058e7e233e3d6","observation_id":"9f53fd8b-a68e-41da-ab0b-ec1eccde035d","resolution":{"observed_at":"2026-05-20T11:03:13.458098Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling autoregressive models for content-rich text-to-image generation","venue":null,"work_id":"03a99397-186f-4cd9-a508-56ce09208a98","year":2022},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:422d26d1ac171411700ef8ba97f8f0e744504f50fde0449c1b51bb2fec33e891","observation_id":"96c3b084-3c8b-484b-8aa4-572b660b0c83","resolution":{"observed_at":"2026-05-20T11:03:26.333772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hauptmann, Ming-Hsuan Yang, Yuan Hao, Irfan Essa, and Lu Jiang","venue":null,"work_id":"60cf0296-8f95-40d3-9d2c-8d60f4dea64d","year":2023},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:6ccf0de2dd0e245a285c4984737ccc0d70ffd5e2a3b70ce6013d92e47fb04cb5","observation_id":"9915826e-ee5a-43c4-91d0-4356c29ed97c","resolution":{"observed_at":"2026-05-20T11:03:26.298985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Randomized autoregressive visual generation","venue":null,"work_id":"8eddf180-7765-4880-b814-3bfa6a42de92","year":2024},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:df89ef506e47feacf50ca0ab6d1791a182530083f9da2281d05e8a39780e8254","observation_id":"e695229d-c8f4-48b9-a5e4-59aa7f00e9d9","resolution":{"observed_at":"2026-05-20T11:03:26.356374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07550","last_updated":"2024-06-11T17:59:56Z","snapshot_observed_at":"2026-08-16T13:44:02.831519Z","submitted_at":"2024-06-11T17:59:56Z","title":"An Image is Worth 32 Tokens for Reconstruction and Generation","version":1},"cited_work":{"arxiv_id":"2406.07550","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.07550","snapshot_observed_at":"2026-06-29T18:13:49.010757Z","title":"arXiv preprint arXiv:2406.07550 , year=","venue":null,"work_id":"6f31b70b-1d0f-4be8-be4e-ee3e78267386","year":2024},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/2406.07550","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:eff27dca1a757b824c0a03e28df71342bec892d9f11e65be679570020dd10c43","observation_id":"df817617-febd-48ed-9a38-f9ca51fe0792","resolution":{"observed_at":"2026-05-20T11:03:13.487184Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06940","last_updated":"2025-06-18T04:35:42Z","snapshot_observed_at":"2026-07-06T19:30:26.233621Z","submitted_at":"2024-10-09T14:34:53Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","version":4},"cited_work":{"arxiv_id":"2410.06940","doi":"10.48550/arxiv.2410.06940","metadata_source":"pith","pith_arxiv_id":"2410.06940","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","venue":"cs.CV","work_id":"1aff8ef8-079b-4afe-9e6a-148e6fd08e6a","year":2024},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/2410.06940","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:3471e7e1411fb90a1a3ba065d36cb56fd6aa517a74e605c89ab8b3fe2395eb3d","observation_id":"f16ad447-eab2-429d-b721-9d57f3d2e685","resolution":{"observed_at":"2026-05-20T11:03:13.466288Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"dd53c5e7-c508-471d-bade-7544508667ad","year":2023},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:c14dcf3a7e063fe0eadd315d915b7f43908a8a00b6ac3bdbb9fcb7f38d2a85a1","observation_id":"b6592722-2279-4413-98d5-201a1398e249","resolution":{"observed_at":"2026-05-20T11:03:26.310543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":"acc57348-1569-4f8e-bc61-ddd22d687b45","year":2018},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:378b6d8d46c8d00bdb34e577ba12731ea3ea4c670bbaf0c327c3800e50580360","observation_id":"d91df3cb-cce2-4775-9bed-e52ddb214be8","resolution":{"observed_at":"2026-05-20T11:03:26.342145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Holistic tokenizer for autoregressive image generation","venue":null,"work_id":"78475db0-2b5d-4b0c-a083-ad96a7c1a398","year":2025},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:5c6204298fd20deeb51f0ac9ba18fefc6305ef2cec4550faba6f9e3c628070e4","observation_id":"c2180349-ac9d-45af-88c5-48f7968560c0","resolution":{"observed_at":"2026-05-20T11:03:26.358669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.08441","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:38:28.915950Z","title":"arXiv preprint arXiv:2507.08441 , year=","venue":null,"work_id":"f438612e-bb10-45c3-8662-4cbe16b00f44","year":2025},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:28b7239e8dd92eeb163613fa0e0b261cd1410319e2be4f0b39dfe5b3a8e530b9","observation_id":"5f27f037-a6bf-41ad-ae26-5f5442484552","resolution":{"observed_at":"2026-05-20T11:03:13.469337Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.11690","last_updated":"2025-10-13T17:51:39Z","snapshot_observed_at":"2026-08-13T23:51:28.874833Z","submitted_at":"2025-10-13T17:51:39Z","title":"Diffusion Transformers with Representation Autoencoders","version":1},"cited_work":{"arxiv_id":"2510.11690","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.11690","snapshot_observed_at":"2026-07-10T18:47:31.703880Z","title":"Diffusion Transformers with Representation Autoencoders","venue":"cs.CV","work_id":"c1a2d4de-4439-4005-8c56-e0124e4ed5fa","year":2025},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/2510.11690","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:30fc80406527f24fce32f65fa4885c9c3519a1f25135b03b1fd60cf07ad0d43a","observation_id":"f40168af-01ef-4c09-9325-62c5c106458f","resolution":{"observed_at":"2026-05-20T11:03:13.553297Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Movq: Modulating quantized vectors for high-fidelity image generation","venue":null,"work_id":"60a2cb50-fe85-49c7-9628-61bbdae5248a","year":2022},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:9128f7ae932f5f5a72723866a83a158a2fc87f5bf686623394803cd46a41fd8f","observation_id":"764c9b29-8e43-4f63-b9c6-4cd0fe1d0125","resolution":{"observed_at":"2026-05-20T11:03:26.306135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09305","last_updated":"2024-03-05T01:10:18Z","snapshot_observed_at":"2026-08-16T15:23:34.823593Z","submitted_at":"2023-06-15T17:38:48Z","title":"Fast Training of Diffusion Models with Masked Transformers","version":2},"cited_work":{"arxiv_id":"2306.09305","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09305","snapshot_observed_at":"2026-07-04T16:59:57.977754Z","title":"Zheng, W","venue":null,"work_id":"a43c3057-0634-4c2b-b3dc-78d15ca3029d","year":2023},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/2306.09305","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:36d881d9a9de6275e5f956bd7b84b0d854b89cf0f6b1d677f40d0363b5d68824","observation_id":"07539e4e-6a3f-4ae2-ae0c-00fbec1cf69b","resolution":{"observed_at":"2026-05-20T11:03:13.472208Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ibot: Image bert pre-training with online tokenizer","venue":null,"work_id":"dd0178e4-5d24-4446-a981-b43bf6d16686","year":2022},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:94dcb4bf60debff1b0f8cb174999ba0020f23965560d2b713452e69977e638f7","observation_id":"985670ae-37ab-402a-a5c9-6117c06516b1","resolution":{"observed_at":"2026-05-20T11:03:26.383587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T12:40:03.512398Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":6,"parse_uncertain":0,"unresolved":0,"verified_exact":38,"verified_fuzzy":56},"total_outbound_references":104},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 100 of 104 outbound references and 1 inbound Pith citation observation for arXiv:2605.18390."}