{"as_of":"2026-08-07T21:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6e20e816dec28973217e025989bd3bf0417dbb875b49c70661510378ab1408eb","coverage":[{"denominator":94,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":94,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:01:49.976800Z","state":"measured"},{"denominator":94,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":94,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.20214/citation-record","integrity":"/paper/2506.20214/integrity","json":"/paper/2506.20214/citation-record.json","paper":"/paper/2506.20214"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T23:01:49.550995Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.550995Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:9755fd2b8e81730e6c8cc5f910956fde88f9a30666c22832457c56f5aab2f933","observation_id":"872bb111-9d23-41b6-9b8e-0ae57d180100","resolution":{"observed_at":"2026-08-06T23:01:49.550995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.556467Z","title":"Foundation models defining a new era in vision: a survey and outlook.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.556467Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:333fb879f38806e19a2aeeb335959ac9ab16a9a72f446bd60fb5f8f5dfaf105e","observation_id":"c519187e-b57e-478a-bbb5-2104d25374b8","resolution":{"observed_at":"2026-08-06T23:01:49.556467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-06T23:01:49.561153Z","title":"Qwen technical report.arXiv preprint arXiv:2309.16609, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.561153Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:d54f2832ae2a5abd1e320b3b843e96f7c5b8170fa83dff88076be607ddb1274c","observation_id":"ff2c862b-d8d5-4b29-89a1-d4071d76d42e","resolution":{"observed_at":"2026-08-06T23:01:49.561153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T23:01:49.566349Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.566349Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:0b017da6f6abef57c8852dc39756e48663a0af33529d9f21bad90a12c5b39be9","observation_id":"9e2bc2f0-20ff-4014-95f4-5d937639e659","resolution":{"observed_at":"2026-08-06T23:01:49.566349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16681","last_updated":"2024-11-27T17:04:36Z","snapshot_observed_at":"2026-07-06T19:56:43.637339Z","submitted_at":"2024-11-25T18:59:53Z","title":"Factorized Visual Tokenization and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16681","snapshot_observed_at":"2026-08-06T23:01:49.571001Z","title":"Factorized visual tokenization and generation.arXiv preprint arXiv:2411.16681, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.571001Z"},"links":{"cited_paper":"/paper/2411.16681","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:7741adbcb98af78c6e41b127d64f6761e35ddb6bfdee613e98aa48d13b403462","observation_id":"c6c07830-669c-4a0c-a60d-4e6f2a51b4ff","resolution":{"observed_at":"2026-08-06T23:01:49.571001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08254","last_updated":"2022-09-03T14:11:33Z","snapshot_observed_at":"2026-07-06T11:19:34.705520Z","submitted_at":"2021-06-15T16:02:37Z","title":"BEiT: BERT Pre-Training of Image Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08254","snapshot_observed_at":"2026-08-06T23:01:49.575932Z","title":"Beit: Bert pre-training of image trans- formers.arXiv preprint arXiv:2106.08254, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.575932Z"},"links":{"cited_paper":"/paper/2106.08254","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:b8fdd0978472124dad5e2b71284811774a98952fe33e6b4a02eacbc83098b201","observation_id":"f8fb298e-2b8e-4ef4-b4a7-557b3cc17120","resolution":{"observed_at":"2026-08-06T23:01:49.575932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.581184Z","title":"Improving image generation with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.581184Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:1e8478550c558a653c83d01edc84b365d4ec1bb935e329c11bb4fe60c587871e","observation_id":"bd2f5d7a-2895-443e-b3ae-5a59da144700","resolution":{"observed_at":"2026-08-06T23:01:49.581184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.586310Z","title":"Efficient-vqgan: Towards high-resolution image generation with efficient vision transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.586310Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:0ab73863598c8de077ece2bc1b3930931253bde914875cbd641305e0cadd6846","observation_id":"1b4190ce-a9a4-46cb-a7da-e4fbc838671b","resolution":{"observed_at":"2026-08-06T23:01:49.586310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-06T23:01:49.590864Z","title":"Pixart-alpha: Fast training of diffusion transformer for photorealistic text-to-image synthesis.arXiv preprint arXiv:2310.00426, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.590864Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:f31572351327a4d038f8f94ebea7548a71371935a4f59551953e1b257057c0af","observation_id":"816e7878-d28f-448d-a0f6-60b9fb2112c2","resolution":{"observed_at":"2026-08-06T23:01:49.590864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.596284Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.596284Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:09504e167abac53abdb45fb7666a49a1484cbd2da70f243cf83afbde94dc6a1c","observation_id":"9506d091-090d-4eb3-acaf-49d4a46c20cc","resolution":{"observed_at":"2026-08-06T23:01:49.596284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-06T23:01:49.600626Z","title":"Are we on the right way for evaluating large vision-language models?arXiv preprint arXiv:2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.600626Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:8ae17c63460070e4fca8d21fc12d3c81e1cd78f5ff3ff38b199a34961a68d5b9","observation_id":"64a43b10-e34a-4164-b74c-3f6c65919106","resolution":{"observed_at":"2026-08-06T23:01:49.600626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.605012Z","title":"Mai: A multi-turn aggregation- iteration model for composed image retrieval","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.605012Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:6eca46200eafeae68cf84eb0135779da31625110d5bf40c34f30fa1b8284638b","observation_id":"58253b53-f465-41f8-972c-0209037c50fb","resolution":{"observed_at":"2026-08-06T23:01:49.605012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-06T23:01:49.609193Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.609193Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:903702b08b33a2c6b1ef575f6599721ff676d91d0ee48b7033f8790ac2ed7f42","observation_id":"0e6275c0-886e-40ec-9c56-8ffdf8686cb0","resolution":{"observed_at":"2026-08-06T23:01:49.609193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.613792Z","title":"Semhitok: A unified image tokenizer via semantic-guided hierarchical codebook for multimodal understanding and generation.arXiv preprint arXiv:2503.06764, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.613792Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:5285acf5e0e36bd78ceece274a2687d9e0dae5f28654782b0036fed686790523","observation_id":"a7fe78e5-91cf-4dcf-82af-54c450071935","resolution":{"observed_at":"2026-08-06T23:01:49.613792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06135","last_updated":"2024-07-08T17:08:02Z","snapshot_observed_at":"2026-07-06T18:43:09.852565Z","submitted_at":"2024-07-08T17:08:02Z","title":"ANOLE: An Open, Autoregressive, Native Large Multimodal Models for Interleaved Image-Text Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06135","snapshot_observed_at":"2026-08-06T23:01:49.618223Z","title":"Anole: An open, autoregressive, native large multimodal models for interleaved image-text generation.arXiv preprint arXiv:2407.06135, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.618223Z"},"links":{"cited_paper":"/paper/2407.06135","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:f151ba20228ccd9666f2139bc569cf4ed011f509cc41ab10433e5f08aca91328","observation_id":"5b1cc51a-8109-4340-8a18-1e8590487aa4","resolution":{"observed_at":"2026-08-06T23:01:49.618223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11499","last_updated":"2024-03-15T19:19:28Z","snapshot_observed_at":"2026-07-06T16:21:25.401345Z","submitted_at":"2023-09-20T17:58:05Z","title":"DreamLLM: Synergistic Multimodal Comprehension and Creation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11499","snapshot_observed_at":"2026-08-06T23:01:49.622707Z","title":"Dreamllm: Synergistic multimodal comprehension and creation.arXiv preprint arXiv:2309.11499, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.622707Z"},"links":{"cited_paper":"/paper/2309.11499","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:744c78fd66fc69f4a9b2e437827c14d700ab16e28fc14eeb6ef5d87ad6ef56ad","observation_id":"df0a9eeb-3faf-47ed-84cb-1e5802130594","resolution":{"observed_at":"2026-08-06T23:01:49.622707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.627390Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.627390Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:cc14137f2b0932c5e5df23ae5ee13fb0c3821b55e1ef908b309488a4f09306aa","observation_id":"8ed18f1b-c6ee-44bf-8092-f2139cc88e44","resolution":{"observed_at":"2026-08-06T23:01:49.627390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.631713Z","title":"Eva-02: A visual representation for neon genesis.Image and Vision Computing, 149:105171, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.631713Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:c79340637c49e37c57a08889cd0b09827613313fff19f7eb0dc8d94e422e297a","observation_id":"ec0c0661-7393-4f8f-8e30-722e711d7eea","resolution":{"observed_at":"2026-08-06T23:01:49.631713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.636345Z","title":"Eva: Exploring the limits of masked visual representation learning at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.636345Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:567f600ba6d6f7bce3f844686a874a8d08e361c42c6a10805330a3749f62be49","observation_id":"f3ff8017-8113-478e-a766-99933325d007","resolution":{"observed_at":"2026-08-06T23:01:49.636345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-06T23:01:49.640623Z","title":"Seed-x: Multimodal models with unified multi-granularity comprehension and generation.arXiv preprint arXiv:2404.14396, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.640623Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:4ba8c246e0d2b34ecdf0806624b28e60b14551058ca98a7b8dcae7e310b9f34e","observation_id":"a9370ca3-f9b0-4ecd-9790-ca3683e7cd07","resolution":{"observed_at":"2026-08-06T23:01:49.640623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.645064Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment.Advances in Neural Information Processing Systems, 36:52132–52152, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.645064Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:ab0008b7518afcce6c6de50a1f1dc2f9b6c6bb4d67eb4aa6e9345210ab0e3bd6","observation_id":"d21b8d60-4825-4754-93c6-e0b072fb4956","resolution":{"observed_at":"2026-08-06T23:01:49.645064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.649556Z","title":"A survey on self-supervised learning: Algorithms, applications, and future trends.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.649556Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:4adfaeb195c8e2b5800020179c83f1151b2eaf67cf2b72984661349700b05134","observation_id":"c5dfdd9f-140d-4262-92ef-2e1fb81f2bbf","resolution":{"observed_at":"2026-08-06T23:01:49.649556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-04T23:51:18.339338Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-06T23:01:49.654183Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment.arXiv preprint arXiv:2403.05135, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.654183Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:59528a98b2dbb24c7e54101dd7d9cae9069a65e23b9a8627bd24c1aa630a6b87","observation_id":"07d11dca-9be3-4a51-9a81-ff3f8b66c356","resolution":{"observed_at":"2026-08-06T23:01:49.654183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01934","last_updated":"2025-04-03T16:43:14Z","snapshot_observed_at":"2026-08-07T16:13:53.338367Z","submitted_at":"2025-04-02T17:45:00Z","title":"ILLUME+: Illuminating Unified MLLM with Dual Visual Tokenization and Diffusion Refinement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01934","snapshot_observed_at":"2026-08-06T23:01:49.658476Z","title":"Illume+: Illuminating unified mllm with dual visual tokenization and diffusion refinement.arXiv preprint arXiv:2504.01934, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.658476Z"},"links":{"cited_paper":"/paper/2504.01934","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:b4fb3046ed48aefb8f1ca15ced6acb43dc90cd084faf955101263dea6260ece9","observation_id":"4d2afe1e-87aa-4b55-9add-f11e96ef60c8","resolution":{"observed_at":"2026-08-06T23:01:49.658476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.662775Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.662775Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:9443d40e45e58f36a1b3f88929164bf72278cb7111c180c152352261cbbeb443","observation_id":"808afccd-3930-4e07-9246-7950dbbabb36","resolution":{"observed_at":"2026-08-06T23:01:49.662775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04423","last_updated":"2025-04-06T09:20:49Z","snapshot_observed_at":"2026-08-07T16:08:15.150652Z","submitted_at":"2025-04-06T09:20:49Z","title":"UniToken: Harmonizing Multimodal Understanding and Generation through Unified Visual Encoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04423","snapshot_observed_at":"2026-08-06T23:01:49.667271Z","title":"Unitoken: Harmonizing multimodal understanding and generation through unified visual encoding.arXiv preprint arXiv:2504.04423, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.667271Z"},"links":{"cited_paper":"/paper/2504.04423","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:fc587cf7c064c5a6da297f15724dda471dedb166af9ded170fe114e297cb7ee5","observation_id":"185a68ec-e17a-4264-a362-0c073d654f6d","resolution":{"observed_at":"2026-08-06T23:01:49.667271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.671702Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.671702Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:a67514e95d11aab2d3c98b635ad4b72f2e2ff53649e71b0f29f515bd17a277fc","observation_id":"5e474d8d-49d9-4e70-baca-5c8574236730","resolution":{"observed_at":"2026-08-06T23:01:49.671702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.676112Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.676112Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:47804e00404aac097c5a3258838d31dbdf1f3270eeb5d8c4e21481bdf0b86054","observation_id":"d1a0a8bb-4238-4767-ab93-68179d7ffadf","resolution":{"observed_at":"2026-08-06T23:01:49.676112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.680540Z","title":"Autoregressive image generation using residual quantization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.680540Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:a63e21875a4d4affdcb5ef9963ed79eac6c6c3e431ccf269494b7c8b1a808976","observation_id":"e2dad82a-0490-4401-a0fa-dd809acb4476","resolution":{"observed_at":"2026-08-06T23:01:49.680540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T23:01:49.684769Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.684769Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:03ee7ab92e2aeed692ad8123995e42e4532b46688842c1dcd4ce4a3f03a46826","observation_id":"9a5a63a1-7d84-4fa7-9c57-fe42d513137f","resolution":{"observed_at":"2026-08-06T23:01:49.684769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-06T23:01:49.688963Z","title":"Seed- bench: Benchmarking multimodal llms with generative comprehension.arXiv preprint arXiv:2307.16125, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.688963Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:b40c1f9343c5fd56bf214df484e3be11efd751e620d8a98e65a7365e4cc8a848","observation_id":"e6328eb0-7a09-4e34-b5f5-ade67c75f138","resolution":{"observed_at":"2026-08-06T23:01:49.688963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:51.843982Z","title":"A survey of multimodel large language models","venue":null,"work_id":"ae99abd8-e3e4-4fdb-94d2-864ddd4f5d47","year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.693312Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:1f7f6c40f450f89b80ed0b95c8263c7ec704c46e67ba682cbd6ccd0e0ba974dd","observation_id":"dfb0530e-9d56-4664-9f36-9be5475d79c5","resolution":{"observed_at":"2026-08-06T23:01:51.849440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:51.819609Z","title":"Toklip: Marry visual tokens to clip for multimodal comprehension and generation, 2025","venue":null,"work_id":"c4cde09a-c395-4548-90e1-9b5395837350","year":2025},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.697319Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:b6c290fb8dbfb7fcd3dee92e21baae41e077362520a2ba939df338819a869f9b","observation_id":"2208cd6b-3b7a-431b-924a-1ad2e4eedd7d","resolution":{"observed_at":"2026-08-06T23:01:51.831628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-05T16:01:06.026395Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-08-06T23:01:49.702024Z","title":"World model on million-length video and language with blockwise ringattention.arXiv preprint arXiv:2402.08268, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.702024Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:be4a133b61ae3ad4dfb7e6887cff925d62ffd510f53118e579a5e98cb07087dc","observation_id":"cb6bdd6f-6d7e-4939-8f90-cacfc8886da7","resolution":{"observed_at":"2026-08-06T23:01:49.702024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.706281Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.706281Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:7b226ca3fb78d81d84e4c0004920349fd4c3d62ca6d10ceb4c42718a86e97cb7","observation_id":"69d9c7a3-63e9-4f07-b34c-8b154f8d7278","resolution":{"observed_at":"2026-08-06T23:01:49.706281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.710584Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.710584Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:ed22ed82a87016ea4d0a7944069dadded44ab5eb761776f1358190c3e6c412e6","observation_id":"801b98e7-a0c7-4180-875f-475dbc187d5f","resolution":{"observed_at":"2026-08-06T23:01:49.710584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.715276Z","title":"Mmbench: Is your multi-modal model an all-around player? InEuropean conference on computer vision, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.715276Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:1b07e882cdbfef95cc67962a057f1b64fc99e82c4c9f8075cbb1c6edde0cc81a","observation_id":"b7310155-5a00-4fd4-bf02-b6a5ee3a3858","resolution":{"observed_at":"2026-08-06T23:01:49.715276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T23:01:49.719739Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.719739Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:1c2ea143088225f108cc8bca6a41bc139a533d97cec6b2a3a5bd882fdcd0ac48","observation_id":"c07dfd61-d9a0-43b6-aea3-adad6cb73cf1","resolution":{"observed_at":"2026-08-06T23:01:49.719739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-06T10:47:13.078840Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-06T23:01:49.723984Z","title":"Ovis: Structural embedding alignment for multimodal large language model.arXiv preprint arXiv:2405.20797, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.723984Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:854b00a665b1fd5b7fc41acaf5215f66bc7c1d1c39ebcf26d88fbfdc2ea9a128","observation_id":"b9e15661-e791-481c-8847-73d935275cfd","resolution":{"observed_at":"2026-08-06T23:01:49.723984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.728398Z","title":"Unitok: A unified tokenizer for visual generation and understanding.arXiv preprint arXiv:2502.20321, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.728398Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:0e143b37746487e4a18d0979630de3ab03e5573741cbd3dadb1dd73c59be1b3d","observation_id":"0297c9ca-c531-4fde-bd37-81888fd2e27f","resolution":{"observed_at":"2026-08-06T23:01:49.728398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07975","last_updated":"2025-03-24T08:33:32Z","snapshot_observed_at":"2026-07-06T19:49:17.129421Z","submitted_at":"2024-11-12T17:55:10Z","title":"JanusFlow: Harmonizing Autoregression and Rectified Flow for Unified Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07975","snapshot_observed_at":"2026-08-06T23:01:49.732504Z","title":"Janusflow: Harmonizing autoregres- sion and rectified flow for unified multimodal understanding and generation.arXiv preprint arXiv:2411.07975, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.732504Z"},"links":{"cited_paper":"/paper/2411.07975","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:309ddedb1a617a849b73a714176ba08f36d963fc9d79da3353b4b19eafc82270","observation_id":"b82b6d9c-43e2-4f05-9534-8aad015c5f2a","resolution":{"observed_at":"2026-08-06T23:01:49.732504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06366","last_updated":"2022-10-03T11:47:10Z","snapshot_observed_at":"2026-08-04T18:14:09.239336Z","submitted_at":"2022-08-12T16:48:10Z","title":"BEiT v2: Masked Image Modeling with Vector-Quantized Visual Tokenizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06366","snapshot_observed_at":"2026-08-06T23:01:49.737348Z","title":"Beit v2: Masked image modeling with vector-quantized visual tokenizers.arXiv preprint arXiv:2208.06366, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.737348Z"},"links":{"cited_paper":"/paper/2208.06366","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:05c448f55598af2978ba5fdc4cc86c45621ea9da9d9cfde9a9e780518bb60f32","observation_id":"9393d3d7-75c3-4e01-895d-a6536e095847","resolution":{"observed_at":"2026-08-06T23:01:49.737348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-06T23:01:49.742089Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.742089Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:3bc4570aadf1a33d0c6f2e2e0362c15e7860a8819fb73f5fa6e9b7c43b659e4a","observation_id":"0f870014-1798-4722-a736-f277b0887bea","resolution":{"observed_at":"2026-08-06T23:01:49.742089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03069","last_updated":"2025-08-07T09:08:33Z","snapshot_observed_at":"2026-07-06T20:01:23.373458Z","submitted_at":"2024-12-04T06:46:55Z","title":"TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03069","snapshot_observed_at":"2026-08-06T23:01:49.746510Z","title":"Tokenflow: Unified image tokenizer for multimodal understanding and generation.arXiv preprint arXiv:2412.03069, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.746510Z"},"links":{"cited_paper":"/paper/2412.03069","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:700ad810adb59a36b3f5049c84bb3e5e0d8dc21fdfebe1012c8eb622950d85eb","observation_id":"ce07186b-2fa2-4449-9253-24ff0f49ae5d","resolution":{"observed_at":"2026-08-06T23:01:49.746510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20388","last_updated":"2025-03-20T18:15:30Z","snapshot_observed_at":"2026-08-07T17:41:55.935183Z","submitted_at":"2025-02-27T18:59:08Z","title":"Beyond Next-Token: Next-X Prediction for Autoregressive Visual Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20388","snapshot_observed_at":"2026-08-06T23:01:49.751169Z","title":"Be- yond next-token: Next-x prediction for autoregressive visual generation.arXiv preprint arXiv:2502.20388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.751169Z"},"links":{"cited_paper":"/paper/2502.20388","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:2758cd1f9b63fdcefd57a4d9ce9969dc1cc093bf1f3be168fd443943337de608","observation_id":"25f9e83f-3624-4516-9e8a-ef6009465aa1","resolution":{"observed_at":"2026-08-06T23:01:49.751169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.755625Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.755625Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:4abed2dff6dfc8e05ad867d714ae976b5edc1dd779ef33323b279293484e54bc","observation_id":"bcf6da21-bf3c-4997-9986-9c8c1ee82db2","resolution":{"observed_at":"2026-08-06T23:01:49.755625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02692","last_updated":"2025-03-10T09:01:48Z","snapshot_observed_at":"2026-07-06T20:01:05.921085Z","submitted_at":"2024-12-03T18:59:10Z","title":"Scalable Image Tokenization with Index Backpropagation Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02692","snapshot_observed_at":"2026-08-06T23:01:49.760298Z","title":"Taming scalable visual tokenizer for autoregressive image generation.arXiv preprint arXiv:2412.02692, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.760298Z"},"links":{"cited_paper":"/paper/2412.02692","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:d60f96a2ace80aef575ff09c64806de97ad52db05c0cb3b9d64a062fcc510aa9","observation_id":"c99e1186-de25-478d-9674-808f355f0b44","resolution":{"observed_at":"2026-08-06T23:01:49.760298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.765263Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.765263Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:4217f3db1ce8e20a00a321e71db184fab1c6499070063e9708044091ac67b702","observation_id":"741dca58-6de6-4114-b0c6-f8429c8d91b6","resolution":{"observed_at":"2026-08-06T23:01:49.765263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14324","last_updated":"2026-04-20T17:55:12Z","snapshot_observed_at":"2026-08-02T12:34:37.994590Z","submitted_at":"2025-03-18T14:56:46Z","title":"DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14324","snapshot_observed_at":"2026-08-06T23:01:49.769637Z","title":"Dualtoken: Towards unifying visual understanding and generation with dual visual vocabularies.arXiv preprint arXiv:2503.14324, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.769637Z"},"links":{"cited_paper":"/paper/2503.14324","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:6c18a25e5dfea268aa8601ad4c9e6f69f749c39c05d84b04de8654b805632bf7","observation_id":"c0101e35-3818-4596-b9e2-af2b176910a6","resolution":{"observed_at":"2026-08-06T23:01:49.769637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.774524Z","title":"Journeydb: A benchmark for generative image understanding.Advances in neural information processing systems, 36:49659–49678, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.774524Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:d0e176b818de838d5af0a2c27e9804eefd8cc3c9a17be6f2cd1b33f9e933c2f0","observation_id":"9bea6b54-9227-4f47-b7d0-d89077778d14","resolution":{"observed_at":"2026-08-06T23:01:49.774524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-06T23:01:49.779091Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation.arXiv preprint arXiv:2406.06525, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.779091Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:2fbf4aa7d6de473a402c5da5489f0b62cfcde5f81bc4df28e504af3e0f508b8b","observation_id":"9f449a2c-e8a0-495d-93cf-5922ea91ff05","resolution":{"observed_at":"2026-08-06T23:01:49.779091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.784005Z","title":"Generative multimodal models are in-context learners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.784005Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:68079725d18a823e51a900fc155430b5795927066d8eb2f4e9127433a9318823","observation_id":"6425bd17-4f4f-4304-9a6a-3c9b8059245d","resolution":{"observed_at":"2026-08-06T23:01:49.784005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05222","last_updated":"2024-05-08T02:46:43Z","snapshot_observed_at":"2026-08-06T07:46:37.713769Z","submitted_at":"2023-07-11T12:45:39Z","title":"Emu: Generative Pretraining in Multimodality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05222","snapshot_observed_at":"2026-08-06T23:01:49.788445Z","title":"Emu: Generative pretraining in multimodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.788445Z"},"links":{"cited_paper":"/paper/2307.05222","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:77ead37eb376b6a6aaa43e1292f80cc7e166ed9b03bf412b7e8402f2b83bad38","observation_id":"5ce7e1ae-a651-46ff-b5e7-cbb259228f94","resolution":{"observed_at":"2026-08-06T23:01:49.788445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-06T23:01:49.793100Z","title":"Chameleon: Mixed-modal early-fusion foundation models.arXiv preprint arXiv:2405.09818, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.793100Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:42f73484bf65e51019b5285d01cab40c7f6112b790f75987ea1fb56e74ee9f6d","observation_id":"ef4f571a-8c4f-4036-bd58-ec9d840575eb","resolution":{"observed_at":"2026-08-06T23:01:49.793100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T23:01:49.797577Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.797577Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:3ce95c73657001b5f61d35ed0eb49b7dc3361ab1fefbed368cee6be9b46a2e42","observation_id":"9780d705-0bc5-4c10-9ff9-0cdb2158c955","resolution":{"observed_at":"2026-08-06T23:01:49.797577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.801688Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction.Advances in neural information processing systems, 37:84839–84865, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.801688Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:6ce504bdedce9a050f866493e17dd1ee6c1dc7511167792a1b966045d61011ed","observation_id":"61084d5c-aaa5-43f4-af9d-aa1f029122d5","resolution":{"observed_at":"2026-08-06T23:01:49.801688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-08-06T23:01:49.805911Z","title":"Metamorph: Multimodal under- standing and generation via instruction tuning.arXiv preprint arXiv:2412.14164, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.805911Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:bb72d2592437a8c6b05c52bfe789c8707effcf0682e3f6fd2abc3082f5817598","observation_id":"7a2b6382-157a-4e49-9676-8fe6d40a94d6","resolution":{"observed_at":"2026-08-06T23:01:49.805911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.810741Z","title":"Neural discrete representation learning.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.810741Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:9bbddaf5df5f6ea8c710d2952a16b9f9d359ad84b95163faecfe49a84cc4c570","observation_id":"1e630c62-7010-4cd4-90b4-3c0407fe3f0f","resolution":{"observed_at":"2026-08-06T23:01:49.810741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-07T15:47:52.196895Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07538","snapshot_observed_at":"2026-08-06T23:01:49.815176Z","title":"Discrete visual tokens of autoregression, by diffusion, and for reasoning.arXiv preprint arXiv:2505.07538, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.815176Z"},"links":{"cited_paper":"/paper/2505.07538","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:a1497330c96772581bfe446c1d8937cb438df44f7c29e952e9248d777af1115d","observation_id":"5a97a6a8-26bc-4f56-9a80-f7f0ead67f4b","resolution":{"observed_at":"2026-08-06T23:01:49.815176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06673","last_updated":"2024-12-09T17:11:50Z","snapshot_observed_at":"2026-07-06T20:04:01.034597Z","submitted_at":"2024-12-09T17:11:50Z","title":"ILLUME: Illuminating Your LLMs to See, Draw, and Self-Enhance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06673","snapshot_observed_at":"2026-08-06T23:01:49.819756Z","title":"Illume: Illuminating your llms to see, draw, and self-enhance.arXiv preprint arXiv:2412.06673, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.819756Z"},"links":{"cited_paper":"/paper/2412.06673","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:d2ed94026f4e64e7fb53d598fc2661e4cc1afb3333ed9bf17bf12ba799d93669","observation_id":"8fe5a1de-7e37-4c94-9eb1-8fc0804bb377","resolution":{"observed_at":"2026-08-06T23:01:49.819756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:51.683808Z","title":"Omnitok- enizer: A joint image-video tokenizer for visual generation.Advances in Neural Information Processing Systems, 37:28281–28295, 2024","venue":null,"work_id":"1cd62a94-a1b7-46f7-b827-e9e0a35984ec","year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.824085Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:e72b2611f0c3808b94c4192731e36343925ab918fbddd7278a37a2730574c8b7","observation_id":"5e13fc24-4806-4e23-bae5-cebaa0c79874","resolution":{"observed_at":"2026-08-06T23:01:51.690847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:51.662699Z","title":"Image under- standing makes for a good tokenizer for image generation.Advances in Neural Information Processing Systems, 37:31015–31035, 2024","venue":null,"work_id":"1e73eb92-f310-4923-b4f5-29455140dda3","year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.828530Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:2a4095f8d2e2bb17cc1da6a6efab49aa51b7929fbe426592208c1ec56881670a","observation_id":"5a6f2efd-9e75-46b7-9c18-974d95f567e1","resolution":{"observed_at":"2026-08-06T23:01:51.670739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T23:01:49.832665Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.832665Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:0f1b175a5e8554dce0add4c4cb0a0a9276d6ec7f47b6b2cf2b5ab0d5f57476a7","observation_id":"7a8093d1-edb0-4dca-b5f1-fc8c28582e59","resolution":{"observed_at":"2026-08-06T23:01:49.832665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.837077Z","title":"Image as a foreign lan- guage: Beit pretraining for vision and vision-language tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.837077Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:35ae71621f1ff28a45c46daa986adcc9c8a1519da45b56bab5a4989d246d305c","observation_id":"638346e8-1ae3-4000-b244-7d8e29d0f2e1","resolution":{"observed_at":"2026-08-06T23:01:49.837077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-06T23:01:49.841242Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.841242Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:8407dffd8bb1473705c38d353ad303f72d5940980a2f45f2ae58c6d94e87ee26","observation_id":"fb6c6446-7d35-42f3-9ac2-a12b09e0ca80","resolution":{"observed_at":"2026-08-06T23:01:49.841242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-08-06T23:01:49.845919Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation.arXiv preprint arXiv:2410.13848, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.845919Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:7f41d54b53f91e2733fa6f8be0c13ed6511b6212d89c95ec01b5b1d2b74e52c7","observation_id":"5d49eb60-9db7-43d2-894d-a55ed865ddb7","resolution":{"observed_at":"2026-08-06T23:01:49.845919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","snapshot_observed_at":"2026-08-02T12:56:37.713692Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04332","snapshot_observed_at":"2026-08-06T23:01:49.850509Z","title":"Liquid: Language models are scalable multi-modal generators.arXiv preprint arXiv:2412.04332, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.850509Z"},"links":{"cited_paper":"/paper/2412.04332","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:cb2a1f1d588b9753f2f7b7e20256f7f5ed51ae3cf8399c4c4e0cc2e4e1f060cd","observation_id":"fa027142-f6a4-4ae2-bfcd-7fbd7e199ab2","resolution":{"observed_at":"2026-08-06T23:01:49.850509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:51.629774Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":"0fcc1c3d-666d-4ba1-9eef-d8c7b616bfae","year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.854970Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:0e105e01f9f581467dba353dd9b44bf35a8b13b18bd7cbd6eb4b3b28e43bfbfe","observation_id":"4640a3a0-953a-4ead-be75-c1d4759418dc","resolution":{"observed_at":"2026-08-06T23:01:51.636941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21979","last_updated":"2025-04-22T04:26:58Z","snapshot_observed_at":"2026-08-07T16:31:36.925232Z","submitted_at":"2025-03-27T20:50:38Z","title":"Harmonizing Visual Representations for Unified Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21979","snapshot_observed_at":"2026-08-06T23:01:49.859294Z","title":"Harmonizing visual representations for unified multimodal understanding and generation.arXiv preprint arXiv:2503.21979, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.859294Z"},"links":{"cited_paper":"/paper/2503.21979","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:edf48b52bc047e300e6d31e2b9380bec181f605a4c290059949bb219319f1536","observation_id":"58a09def-c607-40c0-b40f-9ea28861d1b1","resolution":{"observed_at":"2026-08-06T23:01:49.859294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04429","snapshot_observed_at":"2026-08-06T23:01:49.863781Z","title":"Vila-u: a unified foundation model integrating visual understanding and generation.arXiv preprint arXiv:2409.04429, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.863781Z"},"links":{"cited_paper":"/paper/2409.04429","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:661e65ad29bc85d32050d08ad777b491162ece4f170f28215345b98efc70bcbc","observation_id":"94a77910-e224-46a6-a252-85d2bdc4603f","resolution":{"observed_at":"2026-08-06T23:01:49.863781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:51.608339Z","title":"Grok-1.5 vision preview, 6 2024","venue":null,"work_id":"694a8af9-3f1a-4d5c-a023-c189fefe0bf8","year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.868739Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:d5d8832e8344c116bf037b05bd848eab08c39ab6b02458f5a1c4f8ab7448186e","observation_id":"f5143d83-63be-4c9c-be19-75acb5c5b9d2","resolution":{"observed_at":"2026-08-06T23:01:51.616407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11340","last_updated":"2024-11-21T14:09:12Z","snapshot_observed_at":"2026-07-06T19:16:51.512681Z","submitted_at":"2024-09-17T16:42:46Z","title":"OmniGen: Unified Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11340","snapshot_observed_at":"2026-08-06T23:01:49.873348Z","title":"Omnigen: Unified image generation.arXiv preprint arXiv:2409.11340, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.873348Z"},"links":{"cited_paper":"/paper/2409.11340","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:9ae88c23cecd76223715b698e60fba3a4a30d73e60fc52bc7b6f1f4280870818","observation_id":"0c1d8e90-0ad1-47b6-9d5e-1fdb31e97b4f","resolution":{"observed_at":"2026-08-06T23:01:49.873348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-06T23:01:49.878313Z","title":"Show-o: One single trans- former to unify multimodal understanding and generation.arXiv preprint arXiv:2408.12528, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.878313Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:de7af0dc17a993667343f67a8660ffe39a313f2f4ca10b7b2eb880c2643a933f","observation_id":"f267fa33-2a43-494f-843e-1cc236f425db","resolution":{"observed_at":"2026-08-06T23:01:49.878313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17762","last_updated":"2025-07-28T09:54:49Z","snapshot_observed_at":"2026-07-06T19:57:33.013839Z","submitted_at":"2024-11-26T03:33:52Z","title":"MUSE-VL: Modeling Unified VLM through Semantic Discrete Encoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17762","snapshot_observed_at":"2026-08-06T23:01:49.883147Z","title":"Muse-vl: Modeling unified vlm through semantic discrete encoding.arXiv preprint arXiv:2411.17762, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.883147Z"},"links":{"cited_paper":"/paper/2411.17762","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:28932e7e370d1e91f5f80a4329aecd7affe533c99be369e5f9a0bea4167a7caa","observation_id":"eca16e4f-e042-4a5e-9470-7a5a5991c70b","resolution":{"observed_at":"2026-08-06T23:01:49.883147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:51.588092Z","title":"Efficientsam: Leveraged masked image pretraining for efficient segment anything","venue":null,"work_id":"301d8c78-578f-480c-a088-e516ef0267b4","year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.887716Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:f34a9d97854110708bef61dcf42ab76011b25356323ed5658a208e903e48d501","observation_id":"1e4c5d69-034a-48fb-8da2-858ccd1c4813","resolution":{"observed_at":"2026-08-06T23:01:51.595479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T23:01:49.891862Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.891862Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:2c3f753cbd20eb35701cab991bc41412b85f8c8c35c4bebdfbd0c872f050251e","observation_id":"1095fca2-3ae7-4175-a3c6-136135bc4670","resolution":{"observed_at":"2026-08-06T23:01:49.891862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04627","last_updated":"2022-06-05T01:57:58Z","snapshot_observed_at":"2026-07-06T11:56:10.689708Z","submitted_at":"2021-10-09T18:36:00Z","title":"Vector-quantized Image Modeling with Improved VQGAN","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04627","snapshot_observed_at":"2026-08-06T23:01:49.896781Z","title":"Vector-quantized image modeling with improved vqgan.arXiv preprint arXiv:2110.04627, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.896781Z"},"links":{"cited_paper":"/paper/2110.04627","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:aa6b9398042feebfce870dd2e8da89451556605423a9a471df2e9848bcda184a","observation_id":"ec5bb5e2-5f5d-428a-98da-e6ec69ca4aac","resolution":{"observed_at":"2026-08-06T23:01:49.896781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-06T23:01:49.901168Z","title":"Language model beats diffusion–tokenizer is key to visual generation.arXiv preprint arXiv:2310.05737, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.901168Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:29b8ff96bd6add8f756d98d3584f8780b00882ce47b19f3ce1b63e76c8bd94f5","observation_id":"29635d4e-8db5-4ee0-ab66-e5d08ade24e7","resolution":{"observed_at":"2026-08-06T23:01:49.901168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-06T13:03:19.727877Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-06T23:01:49.905672Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.905672Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:a416dcf2c27d63e3915cc2836668e3642f1d83f51ed9f7e9f516994fa053032d","observation_id":"a7f74818-5d00-4ea5-92df-f2b5ab82163e","resolution":{"observed_at":"2026-08-06T23:01:49.905672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.910134Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.910134Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:147e740687dffe6e35309bfde87d4c09a947f6059798da6fdfca7fb477fd9aa0","observation_id":"cf029f21-64fd-48ee-a43b-14918d731c36","resolution":{"observed_at":"2026-08-06T23:01:49.910134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.914438Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.914438Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:df30d03bd2c0a9f6756aa7be9b2e4d1a0d23c1f9c041529a9da7a4eca38b505b","observation_id":"cf06dac7-6d75-4178-848f-b79dcaa58976","resolution":{"observed_at":"2026-08-06T23:01:49.914438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.16980","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:50.381906Z","title":"Token dynamics: Towards efficient and dynamic video token representation for video large language models.arXiv preprint arXiv:2503.16980, 2025","venue":null,"work_id":"e1cac6c1-6236-4863-89be-448861668ca1","year":2025},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.919010Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:82b4e9401c94b6533b7aeae1fbf0349197a03e593245d76c748d152b1a2d1bb4","observation_id":"7ffabdac-a96f-46a5-84fe-6fb89690a743","resolution":{"observed_at":"2026-08-06T23:01:50.399667Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.923951Z","title":"Unified multimodal understanding and generation models: Advances, challenges, and opportunities.arXiv preprint arXiv:2505.02567, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.923951Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:a757526287d1ca9be662d543088a2efba5377a40dc0412e315e883bf6522afaf","observation_id":"5b8708d8-348c-4e4b-9285-0ba2dd27d76a","resolution":{"observed_at":"2026-08-06T23:01:49.923951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-07-06T20:33:01.960703Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05178","snapshot_observed_at":"2026-08-06T23:01:49.928203Z","title":"Qlip: Text-aligned visual tokenization unifies auto-regressive multimodal understanding and generation.arXiv preprint arXiv:2502.05178, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.928203Z"},"links":{"cited_paper":"/paper/2502.05178","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:54bade39ab286ad62e276dffd7aed549f05ad3a8c4718222a9ddeded2e2a3764","observation_id":"cf687e1a-b5f5-4563-a753-5427cbecb4a8","resolution":{"observed_at":"2026-08-06T23:01:49.928203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.932726Z","title":"Online clustered codebook","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.932726Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:05b9a7c5c6020ec391fa209db5b278b04b7bca8b43a589bdea71e21db4cca255","observation_id":"f4809218-b996-4377-b2ec-af22cdef42a5","resolution":{"observed_at":"2026-08-06T23:01:49.932726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-06T23:01:49.937018Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model.arXiv preprint arXiv:2408.11039, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.937018Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:6b58c9a42a4ba6d07c8f0aad1a97c67418cb366388530549d7817ff3b97c5b25","observation_id":"84e2bf29-c556-4028-856a-f85857f84d14","resolution":{"observed_at":"2026-08-06T23:01:49.937018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11837","last_updated":"2024-06-17T17:59:57Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:59:57Z","title":"Scaling the Codebook Size of VQGAN to 100,000 with a Utilization Rate of 99%","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11837","snapshot_observed_at":"2026-08-06T23:01:49.941622Z","title":"Scaling the codebook size of vqgan to 100,000 with a utilization rate of 99%.arXiv preprint arXiv:2406.11837, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.941622Z"},"links":{"cited_paper":"/paper/2406.11837","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:c9a8791d3ff21bf776a86ffe5b42f6dd01254d85ad5c241ca85db6b98b5ccbc1","observation_id":"6459ee8c-5f34-43d2-9b3e-5fba6bd2d812","resolution":{"observed_at":"2026-08-06T23:01:49.941622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.946448Z","title":"Addressing representation collapse in vector quantized models with one linear layer.arXiv preprint arXiv:2411.02038, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.946448Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:5efe78c311fb6ab9959e464f84c9c2f41db918252e45af538fcf42d59d0adead","observation_id":"caa43789-6d45-46a6-914e-9f32bf63ae11","resolution":{"observed_at":"2026-08-06T23:01:49.946448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08686","last_updated":"2025-03-11T17:59:46Z","snapshot_observed_at":"2026-08-07T17:12:09.182878Z","submitted_at":"2025-03-11T17:59:46Z","title":"OmniMamba: Efficient and Unified Multimodal Understanding and Generation via State Space Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08686","snapshot_observed_at":"2026-08-06T23:01:49.951366Z","title":"a blue pizza","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.951366Z"},"links":{"cited_paper":"/paper/2503.08686","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:bfa980a071306537da3e89f7693dda134049e77abe0ce19aeb0edc6baf8da3dd","observation_id":"365b6c50-2d1c-47e0-a6eb-2cab4993cf8b","resolution":{"observed_at":"2026-08-06T23:01:49.951366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:51.527914Z","title":"Let E={e 1, ...,eN } ⊂Rd denote visual embeddings sampled from a distribution p(e), and let C={c 1, ...,cK} ⊂Rd be a codebook with K discrete centroids","venue":null,"work_id":"da90ff34-95bc-40e4-a95a-5c5a5b04c744","year":null},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.957273Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:c10e1119aa5230b783f9bd5b6d32fd4d072a2dda0128987a9ab958cc4e9183e2","observation_id":"bd75435d-6cf2-420b-88fc-211b99186a4d","resolution":{"observed_at":"2026-08-06T23:01:51.534554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:51.502528Z","title":null,"venue":null,"work_id":"0c87c0fb-0c59-4d08-850f-687482e56450","year":null},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.961746Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:a91212edc62a9dec6c70f60eb5a276cf03f3be9a6ef269a05c7aa7f0b5c8c688","observation_id":"5289fcf7-54c8-430d-9dd6-f00fb34f66e5","resolution":{"observed_at":"2026-08-06T23:01:51.513926Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:51.482462Z","title":"Let y be a semantic target label (e.g., object class, scene type), and let v=Q(e) be the discrete token assigned to embeddinge","venue":null,"work_id":"efcdceca-0ea7-4edc-8a71-265a48f2251c","year":null},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.966452Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:b66e2d1311247bf85e15fe4aff4c15337037f7d1086d7d22ad23d2a6d1b61509","observation_id":"6c9382c1-2830-4073-8eae-1c713deb4564","resolution":{"observed_at":"2026-08-06T23:01:51.489877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:51.463866Z","title":null,"venue":null,"work_id":"aa7a7a52-b331-4305-97cf-1e4a10beecc7","year":null},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.971454Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:5e151862f676a8627c14b506e079c067ed51facbec48991063e94e70f86905bf","observation_id":"a003bd6f-da76-4860-be9c-742ba2295ec1","resolution":{"observed_at":"2026-08-06T23:01:51.469848Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:51.440762Z","title":null,"venue":null,"work_id":"e65f9665-e188-4b71-bd97-d493bab01676","year":null},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.976800Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:09da316ddec2b58cd27405f1a95e9bc49ad1d056268d0f172cbe61b5bd0aa906","observation_id":"af3ee04e-8a70-4148-bbd3-d27b89482896","resolution":{"observed_at":"2026-08-06T23:01:51.448653Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T22:51:43.103000Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation"},"reference_resolution":{"displayed":94,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":84,"verified_exact":1,"verified_fuzzy":9},"total_outbound_references":94},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 94 of 94 outbound references and 0 inbound Pith citation observations for arXiv:2506.20214."}