{"as_of":"2026-08-12T04:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:87f46e12ba740d06ce5871fb53db184fc02fa8923ee9a6707cb9a129e61f1038","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T04:12:58.100610Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.24885/citation-record","integrity":"/paper/2604.24885/integrity","json":"/paper/2604.24885/citation-record.json","paper":"/paper/2604.24885"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flextok: Resam- pling images into 1d token sequences of flexible length","venue":null,"work_id":"1faf3344-8817-4480-af34-e606d26011c4","year":null},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:4afa7389e35a8b541ee185080f10c6a0608f87c39fdae8ac005db21353cf93fa","observation_id":"57347b56-229a-4a40-b72c-9ea9799659a4","resolution":{"observed_at":"2026-05-26T21:18:02.862659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flexivit: One model for all patch sizes","venue":null,"work_id":"b8a8d12b-aa29-42ee-8a2c-78f4c7c59874","year":2023},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:53c4320c00dcd039c099b932add38bc05f817b8ee1e620b091300ecd3792adaf","observation_id":"64e49770-3c38-4960-b8b4-a9da760d4746","resolution":{"observed_at":"2026-05-26T21:18:02.846842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Maskgit: Masked generative image transformer","venue":null,"work_id":"95994bb8-9bf0-4985-92be-e3928583ac89","year":2022},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:c2494139b9ad5dce9dd8cd3c3a7aa049f90307afe630cb410c857e9e2b0310c6","observation_id":"434c5299-0fb1-43f7-a2e5-5a1b93e1cc7d","resolution":{"observed_at":"2026-05-26T21:18:02.887147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"cited_work":{"arxiv_id":"2502.03444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.03444","snapshot_observed_at":"2026-07-04T20:50:11.463918Z","title":"Masked autoencoders are effective tokenizers for diffusion models.ArXiv, abs/2502.03444","venue":null,"work_id":"796bad85-d3e2-4321-8fa5-83fb720de614","year":2025},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"cited_paper":"/paper/2502.03444","citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:ecf12f418bd73ebb82ee34c482d0003347672090c8aaf3a8ed4894990e52536c","observation_id":"c09e4615-7060-4e87-b943-575ace00a510","resolution":{"observed_at":"2026-05-11T21:51:11.648909Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Softvq-vae: Efficient 1-dimensional contin- uous tokenizer","venue":null,"work_id":"ee1cd114-9fee-42c3-a212-55e69926431c","year":2025},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:433d5acd28ec8e62793af793fabded59e1be646a9de79e1aa6f06494866cec35","observation_id":"659429a7-2b41-48b9-a9e1-da3fcf2e4216","resolution":{"observed_at":"2026-05-26T21:18:02.821232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Patch n’pack: Navit, a vision transformer for any aspect ratio and resolution.Advances in Neural Information Processing Systems, 36:2252–2274","venue":null,"work_id":"dd76b3ef-afb4-456c-9efe-214d287a1717","year":2023},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:77a49147076cc81085a20b2d2229364c64095c99fadbd9c7994bc456d730f05c","observation_id":"c6113849-709c-40f5-aadd-d97579991a1d","resolution":{"observed_at":"2026-05-26T21:18:02.859544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T07:46:04.115155Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"2ceaa1cc-7fe4-4be7-826b-13be8734c60f","year":2009},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:33d497004e14f67ea56c42160486595bc5fa3afb47c1fc1b601917a1f13e57ca","observation_id":"561635ae-df8b-4026-8aea-c45a87639141","resolution":{"observed_at":"2026-05-26T21:18:02.843827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":"2010.11929","doi":"10.1175/jcli-d-22-0357.1","metadata_source":"pith","pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","venue":"cs.CV","work_id":"e96730e3-129b-4db6-b981-15ab7932e297","year":2020},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:3a534ebaa8df7d1c6438b5869c5dff7898389b0436ab31c5f242e3c6c3aa833a","observation_id":"27f8afd2-b80d-4439-8b2f-124070b2c538","resolution":{"observed_at":"2026-05-11T21:51:11.659546Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adaptive length image tokenization via recurrent allocation","venue":null,"work_id":"55f80e02-b58b-4318-a3da-7d7eb1c56398","year":2024},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:9252308b82a3ef0eb69dce24407f10d3cde59f6d8fa9400b8a49f83aa17efd0a","observation_id":"934dc4bb-aa79-408d-91e1-f46463aa5567","resolution":{"observed_at":"2026-05-26T21:18:02.838006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":"9ac0d5f1-ddc1-4cab-965f-0504c453feb6","year":2021},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:d2209cb27a15a120c4d2e7c3604623b8e316ee963959c21b799e4b86a7c9fe7a","observation_id":"6259f07e-1825-492c-8e6d-fe80cb2adc4a","resolution":{"observed_at":"2026-05-26T21:18:02.882166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling rectified flow trans- formers for high-resolution image synthesis","venue":null,"work_id":"3b53c935-c532-4bbc-b9fe-da2b43b014eb","year":2024},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:68e610b6933133634ac7b99994039e8efa57306c0c395e9614f73c6ac428468e","observation_id":"213e37ba-8ca2-44b4-8ef9-8e319332b181","resolution":{"observed_at":"2026-05-26T21:18:02.811586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18361","last_updated":"2024-03-28T14:59:44Z","snapshot_observed_at":"2026-08-12T04:13:49.996653Z","submitted_at":"2024-03-27T08:53:13Z","title":"ViTAR: Vision Transformer with Any Resolution","version":2},"cited_work":{"arxiv_id":"2403.18361","doi":"10.48550/arxiv.2403.18361","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.18361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vitar: Vision transformer with any resolution","venue":"arXiv (Cornell University)","work_id":"35045e25-4495-458a-833c-02a91ee15807","year":2024},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"cited_paper":"/paper/2403.18361","citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:63c4a2daf21ecc0378be1f437b692ad4e030895937a7d271dbbf4a1ee7c54e4f","observation_id":"bdf6c9be-9284-4ece-b053-17471d34d9bc","resolution":{"observed_at":"2026-05-11T21:51:11.513644Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rotary position embedding for vision transformer","venue":null,"work_id":"f5700023-5a2b-40d1-b9bd-6cabd187d79b","year":2024},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:670a069cbce85f421ac98bbc788035afab688f60493e865b49f7d4253c96745c","observation_id":"a4f2c341-6d84-41c2-bf2a-b451ffeaa4b5","resolution":{"observed_at":"2026-05-26T21:18:02.879255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":"2207.12598","doi":"10.1109/cvpr52733.2024.02494","metadata_source":"pith","pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Classifier-Free Diffusion Guidance","venue":"cs.LG","work_id":"acf2c588-c088-4a6c-938e-150ad7c666d7","year":2022},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:64c088ee1c3922bc96613cdd67fa7032d8c9f2882f360d2777370a5a815bb62a","observation_id":"c1f10377-ebe0-4e8d-a748-bc90f0bb0943","resolution":{"observed_at":"2026-05-11T21:51:11.547896Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Analyzing and improving the training dynamics of diffusion models","venue":null,"work_id":"5191d348-9e9a-4bd4-9f80-3db7cef1773d","year":2024},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:1cd50cb5d40d2994d896197c2ccc2a31e2c75c117e881ca47da267e73110f9a1","observation_id":"5997b0d6-9962-4ab1-a76b-d585c55a2342","resolution":{"observed_at":"2026-05-26T21:18:02.834401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07730","last_updated":"2025-08-02T07:11:16Z","snapshot_observed_at":"2026-08-10T20:34:26.051486Z","submitted_at":"2025-01-13T22:37:17Z","title":"Democratizing Text-to-Image Masked Generative Models with Compact Text-Aware One-Dimensional Tokens","version":2},"cited_work":{"arxiv_id":"2501.07730","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.07730","snapshot_observed_at":"2026-07-05T11:41:02.694837Z","title":"Democra- tizing text-to-image masked generative models with com- pact text-aware one-dimensional tokens","venue":null,"work_id":"4c6ed1d1-ff49-4b68-a43c-c59931ab2c5b","year":2025},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"cited_paper":"/paper/2501.07730","citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:8cc2fcacc8998c88e8bd6adbd8eb803500b9755488d74cde961b4c786bb8ede4","observation_id":"c2b46e44-ba77-4fcb-ad08-b8836ac1689f","resolution":{"observed_at":"2026-05-11T21:51:11.644749Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Autoregressive image generation using resid- ual quantization","venue":null,"work_id":"fe37ae4d-c182-49b2-bfc5-0c7eb34f4920","year":2022},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:5d1a29bc1c8272f9af64a888051f47a1ed9cadffa5658f032606e1a9c242a12f","observation_id":"e03a9532-2e62-4241-b42a-e83b8bf3cc6b","resolution":{"observed_at":"2026-05-26T21:18:02.889946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Autoregressive image generation without vector quantization.Advances in Neural Information Processing Systems, 37:56424–56445","venue":null,"work_id":"02eaff4c-8c53-45d1-8762-fa664aac3486","year":2024},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:8a5d7b7fdbf7e11d9a1da7e463e901a6c31028ba1a61017572cee78f2c86fc4f","observation_id":"52344866-9057-450e-b89d-e8fba5130407","resolution":{"observed_at":"2026-05-26T21:18:02.865501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01756","last_updated":"2024-12-03T20:32:52Z","snapshot_observed_at":"2026-07-31T17:12:13.287514Z","submitted_at":"2024-10-02T17:06:39Z","title":"ImageFolder: Autoregressive Image Generation with Folded Tokens","version":3},"cited_work":{"arxiv_id":"2410.01756","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.01756","snapshot_observed_at":"2026-07-03T14:38:28.817961Z","title":"Imagefolder: Autoregres- sive image generation with folded tokens","venue":null,"work_id":"31c3d642-f3a7-4326-8674-523c08c24d7c","year":2024},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"cited_paper":"/paper/2410.01756","citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:1e142694ab4d18a14a0b75e6ae810cffb14d45bc50e297e63395ab840ff2de6f","observation_id":"8da6bca7-b891-4169-a2cc-b839f7494d03","resolution":{"observed_at":"2026-05-11T21:51:11.526347Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"75a07315-97a0-400a-8d3b-6969dca3ac8a","year":2023},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:b34875adb4a9a156c79aacb37b577d89770f169efff427531d6785d5e5c2c31b","observation_id":"45066fc8-bc02-4a1d-9990-fe5678208045","resolution":{"observed_at":"2026-05-26T21:18:02.814581Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.21473","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T00:47:30.429572Z","title":"Detailflow: 1d coarse-to-fine autoregressive image generation via next-detail prediction.arXiv preprint arXiv:2505.21473, 2025b","venue":null,"work_id":"ba0fec0b-29d8-49de-a5d3-67d7c8667c36","year":2025},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:0e97dc4747b8135e4a01f0803dcc8027ce02a86cba011c7d79ea787bf334696c","observation_id":"1af6f34e-2367-4104-955a-afa89bf6201c","resolution":{"observed_at":"2026-05-11T21:51:11.682061Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.14476","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T20:28:55.806423Z","title":"Zeyu Lu, Zidong Wang, Di Huang, Chengyue Wu, Xihui Liu, Wanli Ouyang, and Lei Bai","venue":null,"work_id":"b79e3885-9295-4ed4-812b-dd2bf87a7a26","year":2025},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:d2e49249406dbcdea829d8426abfec85751944ee0f0cf31d1897ce94fdad4350","observation_id":"75c7c2ba-257d-49f1-b597-737da24701eb","resolution":{"observed_at":"2026-05-11T21:51:11.577778Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12376","last_updated":"2024-10-15T02:51:00Z","snapshot_observed_at":"2026-08-08T17:18:09.872627Z","submitted_at":"2024-02-19T18:59:07Z","title":"FiT: Flexible Vision Transformer for Diffusion Model","version":4},"cited_work":{"arxiv_id":"2402.12376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.12376","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fit: Flexible vision transformer for diffusion model","venue":null,"work_id":"38da81cd-23a3-423f-bbe6-b7d30c811e2b","year":2024},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"cited_paper":"/paper/2402.12376","citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:9042c96a76817515b620910de67e4056448b304ce1eeb841e20d89bcc77fd79c","observation_id":"dce0c06f-883f-4ace-84dc-3b155bf75d1c","resolution":{"observed_at":"2026-05-11T21:51:11.626899Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04410","last_updated":"2025-02-09T08:59:19Z","snapshot_observed_at":"2026-08-06T03:43:29.067278Z","submitted_at":"2024-09-06T17:14:53Z","title":"Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation","version":3},"cited_work":{"arxiv_id":"2409.04410","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.04410","snapshot_observed_at":"2026-07-04T13:09:50.831210Z","title":"Open-magvit2: An open-source project toward democratizing auto-regressive visual gener- ation","venue":null,"work_id":"a2523977-d17d-43e1-8c06-1f6ba1c28388","year":2025},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"cited_paper":"/paper/2409.04410","citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:20007199d65c1c69a59b01703292c6e63b562c46d550fb31df1cc763012d40fd","observation_id":"985ae8cd-ea87-4ad6-885d-83e24cc3f028","resolution":{"observed_at":"2026-05-11T21:51:11.569171Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.20321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:09:50.827602Z","title":"Unitok: A unified tokenizer for visual generation and understanding.arXiv preprint arXiv:2502.20321, 2025a","venue":null,"work_id":"31d5c278-398d-4fee-8130-a864fb6b3717","year":2025},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:4c3a3a5ee3c11cd01280b0a992f8c2ed111e61e9723ae6e1be67b983efa2e4a3","observation_id":"db4a9c4e-867f-4f4c-bb80-d25088bc27b3","resolution":{"observed_at":"2026-05-11T21:51:11.556479Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10064","last_updated":"2025-01-17T09:29:33Z","snapshot_observed_at":"2026-08-10T19:21:21.226983Z","submitted_at":"2025-01-17T09:29:33Z","title":"One-D-Piece: Image Tokenizer Meets Quality-Controllable Compression","version":1},"cited_work":{"arxiv_id":"2501.10064","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.10064","snapshot_observed_at":"2026-07-04T17:40:01.064614Z","title":"One-d-piece: Image tokenizer meets quality- controllable compression","venue":null,"work_id":"1836059f-9b90-4a04-b98c-5a21264475bc","year":2025},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"cited_paper":"/paper/2501.10064","citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:40f2e9c09638fc709afe51061271f604087ea989aece77ae902bb93319ba08d9","observation_id":"09a20df6-e5ce-4cdb-9e50-3408b6da4035","resolution":{"observed_at":"2026-05-11T21:51:11.676182Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":"2112.10741","doi":"10.48550/arxiv.2112.10741","metadata_source":"pith","pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","venue":"cs.CV","work_id":"34430d19-7919-48ce-88a5-17b3bfe2192e","year":2021},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:645f20b2c6a11a14927c6ae4dac7c111730ac70305df0b083b3cc20b3ca4ba53","observation_id":"e5fa4440-0be9-4e2f-8f37-04131caef4a9","resolution":{"observed_at":"2026-05-11T21:51:11.653133Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-21T20:52:26.23702+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T20:52:26.23702+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Eclipse: A resource-efficient text-to-image prior for image generations","venue":null,"work_id":"092329b4-8862-4a73-b4b9-e7b385691fff","year":2024},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:9838cdc7e288e3b8a33ef0778c5093b10a918c6e5089ccc22eda44e27b9fe949","observation_id":"10f0f233-e9fb-48dd-99e5-ce09c6c36be6","resolution":{"observed_at":"2026-05-26T21:18:02.849773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.715460Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"292e4202-5927-473f-b73e-1d6883498f14","year":null},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:00c97340ffc1a79258733ad12c5cf260b62b6f3cc7ca76b529cd27e5a38d9d55","observation_id":"7b4dbec5-9102-471e-b51a-7f9aa3d17363","resolution":{"observed_at":"2026-05-26T21:18:02.818000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":"2307.01952","doi":"10.48500/arxiv.2307.01952","metadata_source":"pith","pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","venue":"cs.CV","work_id":"8034c587-fba6-4941-87ba-c98f2ac962cb","year":2023},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:f7d614e8d922c576e33af738443b7f8a532afa94327bf2c8182e1e0c0d61a62c","observation_id":"67e3e1fc-c498-4535-938b-cc2b9e4da1be","resolution":{"observed_at":"2026-05-11T21:51:11.666897Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-10T21:41:31.247717Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:e90ccd39c74dd0c0b1bcc20611b96c8e07593d0ae13d787a3ea05086c47b6967","observation_id":"ba183e9b-27b9-4f47-9016-ddbe666ec7d5","resolution":{"observed_at":"2026-05-11T21:51:11.530780Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.12474","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T16:27:09.524802Z","title":"Image tokenizer needs post-training.arXiv preprint arXiv:2509.12474","venue":null,"work_id":"2539f736-2486-4d65-b730-85205780e609","year":2025},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:b29084dd4faea345e03dc917005c896b9ed8b5410db489f6a9cd77084ad58c4c","observation_id":"16b99de0-9e75-4799-bf7c-3791e76b9b43","resolution":{"observed_at":"2026-05-11T21:51:11.615558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pho- torealistic text-to-image diffusion models with deep language understanding.Advances in neural information processing systems, 35:36479–36494","venue":null,"work_id":"4f1c222e-b305-4532-9db8-12cab1d20fee","year":2022},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:2a7a5e0148e0b64488c3850e3141504dc4a52a15b879e3071afff944a032b28f","observation_id":"b4cf67fa-625d-4082-987a-217275364fa2","resolution":{"observed_at":"2026-05-26T21:18:02.856540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stretching each dollar: Diffu- sion training from scratch on a micro-budget","venue":null,"work_id":"a7f5f9bd-9491-4c85-8bd7-c86563b58006","year":2025},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:cbc1629e657f6767cffc902fa6a8ba6a4bd3f5dbf394bc176b18645252c018e8","observation_id":"58413aa5-063e-46be-86ea-21d35acf4b24","resolution":{"observed_at":"2026-05-26T21:18:02.876754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scalable image tokenization with index backpropagation quantization","venue":null,"work_id":"b4a4a7e8-1651-4c08-bbdd-032d7f4a5d7f","year":2025},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:fbf0f3d05824547f3f51e370c3d64ec82e1ac4c8ffab026dd718e58d01cc5299","observation_id":"978342ce-977a-4c8b-b183-ffe6c2a54487","resolution":{"observed_at":"2026-05-26T21:18:02.840624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Denoising diffusion implicit models","venue":null,"work_id":"c8e6ffb8-4deb-4f46-832e-fcb65fa4da9c","year":2021},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:b2a1521e11fb5b195477b5706f4f221f22d9403bce3ebfb876016cd9d4ab7ff4","observation_id":"e15859d8-54ca-4ffa-818f-e371fed166ff","resolution":{"observed_at":"2026-05-26T21:18:02.873945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":"2406.06525","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-07-10T11:37:03.266757Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","venue":"cs.CV","work_id":"41efe203-9377-4c63-b1d6-e499cd6e46f6","year":2024},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:0534f9472b35553778bd2d9d4298d45126d9c2ffb3ec21a5ea664a0dcf2d9014","observation_id":"e83dd030-e40f-4a8e-baed-ae2fc66cd853","resolution":{"observed_at":"2026-05-11T22:09:17.130563Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10711","last_updated":"2025-08-18T15:55:23Z","snapshot_observed_at":"2026-08-05T20:12:05.144753Z","submitted_at":"2025-08-14T14:54:22Z","title":"NextStep-1: Toward Autoregressive Image Generation with Continuous Tokens at Scale","version":2},"cited_work":{"arxiv_id":"2508.10711","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10711","snapshot_observed_at":"2026-07-04T00:39:17.418338Z","title":"Nextstep-1: Toward autoregressive image generation with continuous tokens at scale","venue":null,"work_id":"729ea32c-8dd9-4636-a635-97e1ebb2dcd7","year":2025},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"cited_paper":"/paper/2508.10711","citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:a49bba5a6fad4b87cf6d7709468053ee676c064c789664d4b08a29b54c186120","observation_id":"26a7f1ea-5c29-474e-8958-77e998b00eb3","resolution":{"observed_at":"2026-05-11T21:51:11.560529Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction.Advances in neural in- formation processing systems, 37:84839–84865","venue":null,"work_id":"5f8c576b-08a2-48d1-ac84-8c5b5eef2be8","year":2024},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:be4e431d5d8d2cf9b05ec7457b10acc4530885c54ad626d293dbe3592dd41908","observation_id":"afe7c311-37f6-42ab-9352-afff9c4e83c7","resolution":{"observed_at":"2026-05-26T21:18:02.868467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Resformer: Scaling vits with multi-resolution training","venue":null,"work_id":"884aad91-b90e-4a4e-abc0-c81785729891","year":2023},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:4ae989f4546dc1311905b2ed65290ccf3157c48a418ebcf4c7fd2c9178b6a2e7","observation_id":"67d99c61-5f57-4f97-be52-00d550e36925","resolution":{"observed_at":"2026-05-26T21:18:02.871426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training data-efficient image transformers & distillation through atten- tion","venue":null,"work_id":"2fbfde33-85f1-4756-a6ce-52130bd47bf0","year":2021},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:596002a7d7e31033411c7f67a0800f107947d10085b5903cd027df5d6c2bb52b","observation_id":"2fd854af-b2e2-4a09-80a4-f305a4264836","resolution":{"observed_at":"2026-05-26T21:18:02.831749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13925","last_updated":"2024-10-17T15:51:49Z","snapshot_observed_at":"2026-08-11T11:12:31.922902Z","submitted_at":"2024-10-17T15:51:49Z","title":"FiTv2: Scalable and Improved Flexible Vision Transformer for Diffusion Model","version":1},"cited_work":{"arxiv_id":"2410.13925","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.13925","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fitv2: Scalable and improved flexible vision transformer for diffusion model","venue":null,"work_id":"9343b8bb-a25d-4a3d-bbdd-14a4a2505530","year":2024},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"cited_paper":"/paper/2410.13925","citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:427f88c01fdeb45ea8ffd454a75e73d10b8ce7c4a643b829238aeaeeb9845db4","observation_id":"a9b0a434-6be3-4b1c-a30e-a19c43e36994","resolution":{"observed_at":"2026-05-11T21:51:11.538946Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":"2506.03131","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03131","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Native-resolution image synthesis","venue":null,"work_id":"05e39f33-4d2d-4d9e-9904-228f03adc7b2","year":2025},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"cited_paper":"/paper/2506.03131","citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:2dfab8f9b002c9b195db2aa4910e9965e6414d48a3ddcde66fbbf5a7af1e3281","observation_id":"cdf67ea2-5bff-46e8-b1f9-b09fb03a980a","resolution":{"observed_at":"2026-05-11T21:51:11.672181Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21022","last_updated":"2025-06-26T05:48:36Z","snapshot_observed_at":"2026-08-07T15:30:22.761798Z","submitted_at":"2025-06-26T05:48:36Z","title":"Instella-T2I: Pushing the Limits of 1D Discrete Latent Space Image Generation","version":1},"cited_work":{"arxiv_id":"2506.21022","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21022","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instella-t2i: Pushing the limits of 1d discrete latent space image generation","venue":null,"work_id":"77fc8f1e-a93f-40d1-9b7f-0e5ead42c115","year":2025},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"cited_paper":"/paper/2506.21022","citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:bd14680632e69cffc26d73b8a4aa4f7344a04d7fa0b905fef3e6f74188741e8d","observation_id":"6502a31f-1309-4cda-a96c-c72a29e05738","resolution":{"observed_at":"2026-05-11T21:51:11.622758Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16211","last_updated":"2024-12-08T19:55:36Z","snapshot_observed_at":"2026-08-04T16:36:02.143481Z","submitted_at":"2024-09-24T16:12:12Z","title":"MaskBit: Embedding-free Image Generation via Bit Tokens","version":2},"cited_work":{"arxiv_id":"2409.16211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.16211","snapshot_observed_at":"2026-07-02T16:27:09.132431Z","title":"Maskbit: Embedding-free image generation via bit tokens","venue":null,"work_id":"f358dd18-8673-4de8-bc21-126635a0ba2c","year":2024},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"cited_paper":"/paper/2409.16211","citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:2ed244a0dcd44a9c401e7f305a78b9d99e11900cf70f5ef915d201a1f9a64123","observation_id":"c82e461e-cb88-49ad-a1d1-fb78bd30bce8","resolution":{"observed_at":"2026-05-11T21:51:11.606278Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2409.04429","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.04429","snapshot_observed_at":"2026-07-04T13:39:51.496167Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","venue":"cs.CV","work_id":"7039c3ef-6ce4-4c98-96ed-9eef3d669045","year":2024},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"cited_paper":"/paper/2409.04429","citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:f6886d460b3782c404103d90b546b7151e492a24198249c39b5a81760ef38885","observation_id":"0aca68f9-74b9-4aa2-b3ae-d54d87b9bbfd","resolution":{"observed_at":"2026-05-16T00:26:21.484895Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dc-ar: Efficient masked autoregressive image generation with deep compression hybrid tokenizer","venue":null,"work_id":"93ad0f37-ef06-4758-8843-1ec78f84c78a","year":2025},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:85b57b3d32c87859f12a86c25bdd0de26985605a308215fe6ea9fe5e7d4b0b38","observation_id":"df99eef3-7c35-45a5-9c5c-0ac8d3b5eb0d","resolution":{"observed_at":"2026-05-26T21:18:02.892713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08377","last_updated":"2025-03-14T03:16:25Z","snapshot_observed_at":"2026-08-07T17:13:07.553537Z","submitted_at":"2025-03-11T12:38:12Z","title":"Layton: Latent Consistency Tokenizer for 1024-pixel Image Reconstruction and Generation by 256 Tokens","version":3},"cited_work":{"arxiv_id":"2503.08377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.08377","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Layton: Latent consistency tok- enizer for 1024-pixel image reconstruction and generation by 256 tokens.ArXiv, abs/2503.08377","venue":null,"work_id":"ef0578bc-872d-42ac-89e2-c569fe7f4da4","year":2025},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"cited_paper":"/paper/2503.08377","citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:b7901e876033c2e2847eb3824e23336e2312b80977615db62863b078e03526c5","observation_id":"bb64f730-1fe1-4378-8016-f68000c1d019","resolution":{"observed_at":"2026-05-11T21:51:11.587409Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04627","last_updated":"2022-06-05T01:57:58Z","snapshot_observed_at":"2026-07-06T11:56:10.689708Z","submitted_at":"2021-10-09T18:36:00Z","title":"Vector-quantized Image Modeling with Improved VQGAN","version":3},"cited_work":{"arxiv_id":"2110.04627","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.04627","snapshot_observed_at":"2026-07-04T09:49:44.490632Z","title":"Vector-quantized Image Modeling with Improved VQGAN","venue":"cs.CV","work_id":"8ba56539-4766-42a4-868c-f9bef1281034","year":2021},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"cited_paper":"/paper/2110.04627","citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:bc3ed4d50c7893b5ddd4091805ce2cb86636aae04776c6bcfb70189d0a24d2cb","observation_id":"1973197e-3d92-42a3-9c2e-8e3bbc67569a","resolution":{"observed_at":"2026-05-16T18:40:37.571629Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:e38a8ce3d6ca17e7648467bbf4d45704bcb8cec156fbb36dc0d67b747add5bda","observation_id":"7ca49328-e71e-409c-b5c0-1491f78a76af","resolution":{"observed_at":"2026-05-12T04:49:31.747550Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:f3d11fedc3f46b2d05b3b7559b0263abe239090a9942ca1c27430cc96eb7dd21","observation_id":"df0314d0-fa8c-49ba-ab81-30ee5c88deba","resolution":{"observed_at":"2026-05-13T20:06:45.090605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An image is worth 32 tokens for reconstruction and generation.Advances in Neural Information Processing Systems, 37:128940–128966","venue":null,"work_id":"95a3120f-2a39-4014-a406-961a350d3427","year":null},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:25d7594a912ffbfbfece75855a9f0fb75ffb63f5aad2720e5d37fd30e0adef6c","observation_id":"3b0d655a-6315-4eb1-94b6-6ca6eb6954fd","resolution":{"observed_at":"2026-05-26T21:18:02.824410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Randomized autoregressive visual generation","venue":null,"work_id":"86de4fb5-94ff-4d59-a93e-4b53bebde5dc","year":2025},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:2d5021ddd668c91609c4c3f9707b3a6641647c9dde197d3829c0de8e3b45a45d","observation_id":"ecd18e81-4a99-4ad6-8231-846e66123614","resolution":{"observed_at":"2026-05-26T21:18:02.852550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ar- gus: A compact and versatile foundation model for vision","venue":null,"work_id":"1474a72e-e583-4806-af97-52bd1336b770","year":2025},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:8c534cec3b34b1b31c3c0433e9c4b9f292d5d08b63932ff70224705f8eb66a7f","observation_id":"03374ab6-e24c-4841-97a8-80110ecef532","resolution":{"observed_at":"2026-05-26T21:18:02.884762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"256x256\": 0.5","venue":null,"work_id":"f8d2793e-ea66-44c4-a5da-cbb4af1c421f","year":2050},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:a6ec1d32bc825cfa806cc68fd3e8956b28b3ffd95917c1e88762ac9df42f79b6","observation_id":"91b99e6b-dc58-435f-bb19-159511225476","resolution":{"observed_at":"2026-05-26T21:18:02.827657Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T16:54:55.131344Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":1,"verified_exact":26,"verified_fuzzy":26},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2604.24885."}