{"as_of":"2026-08-06T03:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4e5476c9ea202b2d5288839bc3bed17fe98d9836ebde1a4f9fd859423a4317e7","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T22:40:05.761148Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.26089/citation-record","integrity":"/paper/2605.26089/integrity","json":"/paper/2605.26089/citation-record.json","paper":"/paper/2605.26089"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:804a1ed00a7ad8af2bda17565e4fe0da80f768be80a4718293990c026edfae24","observation_id":"cd210e34-18b4-4cf5-8613-34906bdc6a51","resolution":{"observed_at":"2026-06-29T22:44:01.506433Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Flextok: Resampling images into 1d token sequences of flexible length","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:85d09ede866e34ad7676762bb2be24e137e2c4289b4ac4991dc49a93b29dde95","observation_id":"d1d8ae2d-1018-490a-97eb-b56d166c321c","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Language models are few-shot learners.Advances in neural information processing systems, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:91973a8d1ec3ccc30d40eb6dd82bfc25eebb6090f104dba1dc243bef8dde69a1","observation_id":"917cfd70-ade0-42f6-b3a5-f434e01513f9","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Maskgit: Masked generative image transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:401ef934d77d4f1ec3fa4e28fc0d35e4d4dcfa0da3bdee3a76c2390ef42f2b20","observation_id":"ddf73cb8-261a-4544-b022-41bed96f0b7e","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Conceptual 12M: Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:fe40b416c75160a25b02831d8711541ac49ac74f4ee8fd8178a8e700508f6f02","observation_id":"150d572f-96f6-43ad-8895-0c461b2754c2","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-07-06T21:23:57.084147Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":"2505.09568","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-07-08T00:04:22.585543Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","venue":"cs.CV","work_id":"86d896d2-592f-4d9b-938e-dfeb11f9388f","year":2025},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:c876a7aa69b5cb575c26be246a4d81043f1637d156f31a71ecacec8b9d8b729c","observation_id":"0a66aa7d-e2f2-4225-b48b-c78eaf1e8f9d","resolution":{"observed_at":"2026-06-29T22:44:01.503313Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:57f52ee1c7381019420685a2fbc6607ce6c8b078a0e3373250a92d8b66764b50","observation_id":"e265057f-8abc-4bb4-b5ef-bfd0fd7a620d","resolution":{"observed_at":"2026-06-29T22:44:01.512508Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Catok: Taming mean flows for one-dimensional causal image tokenization","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:89b20240b6a5d5a2cf87beccdb93868638956ef6e2296819196c9460b4a609ca","observation_id":"e220561b-f83a-4e5e-a233-4b249e0f795f","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Imagenet: A large- scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:7c1c004ffa5d13fdf3735dfb5e9a2e82e70470e46de8c375a76888bbf34f8f57","observation_id":"c9587df6-6169-4e09-a27e-544bb6aa8b7a","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:05c50fe011aca49833e23e865a56323af8ca5ab6e85be8c9a9a00ce40b0ab995","observation_id":"bf9fb3de-d546-4628-a596-cbb41fe74fc4","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Scaling rectified flow transform- ers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:75c4302a348629cd5beac5b85ca95c02e3b547c40fc00b7bdf9e48ab6b066f4a","observation_id":"6c30c0a8-5b83-4207-96c5-17db729dedae","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Restructuring vector quantization with the rotation trick","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:401b58bb897efe57741292bfc40e8d9f3719af55fd9a810d1ebf1d0e2bd3acc4","observation_id":"467ec79d-708d-48d6-aeed-68e0cf188c08","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Infinity: Scaling bitwise autoregressive modeling for high-resolution image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:78ff023745d0760227671755db308503c60b700c0ef49ccd395fc10ccf540ff7","observation_id":"d8e7ea1d-c731-4451-8f8d-9e0992f4c48a","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Flowtok: Flowing seamlessly across text and image tokens","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:b43eefc05a97c61fec937dd986c5ac319417c90c33bd9876c006698ecd8e3cc2","observation_id":"89dd5760-c5e4-4f74-835d-f56b0a1203b9","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Statistics of patch offsets for image completion","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:60f70835646e6a4f5fc5f0d2905841b2de2775109e25d00648b8214402efe4b5","observation_id":"7f52f454-f1e3-43b5-8d39-f60e454880f5","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Towards accurate image coding: Improved autoregressive image generation with dynamic vector quantization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:31878bc3c75996146dff8f42533cba5bd2c1e008482bfd0d8fb7b44fb51c1c58","observation_id":"63279dcb-b2ef-4916-8ecc-8978acae8c2d","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Spec- tralar: Spectral autoregressive visual generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:5b97831cea94d3b92611ef6f24b33790f53cd665059758e3ecba62ea26007eb2","observation_id":"37518384-0aee-4ea4-9e17-a16b06d92ce2","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.07076","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T15:17:07.158756Z","title":"Nfig: Au- toregressive image generation with next-frequency predic- tion","venue":null,"work_id":"5806182f-b5ba-4464-bc1c-6840eb260526","year":2025},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:6c5509f0eb82e31d7348b2bbf1544487461440e937b231f1c4060f033bbe32b3","observation_id":"e3638e2d-55a1-4fdd-a148-1d03a39acab4","resolution":{"observed_at":"2026-06-29T22:44:01.500686Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Image-to-image translation with conditional adversarial networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:e176112b7153862d224d8ee1fa3ecb3c5aed8857187d974986fb16f93c79694b","observation_id":"13496c26-f688-473f-8f4e-84df637ad9c5","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07730","last_updated":"2025-08-02T07:11:16Z","snapshot_observed_at":"2026-07-06T20:20:37.632750Z","submitted_at":"2025-01-13T22:37:17Z","title":"Democratizing Text-to-Image Masked Generative Models with Compact Text-Aware One-Dimensional Tokens","version":2},"cited_work":{"arxiv_id":"2501.07730","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.07730","snapshot_observed_at":"2026-07-05T11:41:02.694837Z","title":"Democra- tizing text-to-image masked generative models with com- pact text-aware one-dimensional tokens","venue":null,"work_id":"4c6ed1d1-ff49-4b68-a43c-c59931ab2c5b","year":2025},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"cited_paper":"/paper/2501.07730","citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:78b46cae48db68d3c9ce9da30e83322013d536ffbdac2329c05ff912583b3327","observation_id":"fd363285-7cd0-4628-ab96-e87429ad378a","resolution":{"observed_at":"2026-06-29T22:44:01.487565Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Flux.https://github.com/black-forest-labs/flux, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:e7b22dc147cdb607d3b210d8ae1fd4203e6199fe2442ce458e94bd2e8aae2adb","observation_id":"de56f47e-a47d-4854-9efb-05349ad5954d","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Autoregressive image generation using residual quantization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:098f61b88a1d4dee9984fdb7b38097cb4567e266aa44b5043157740c39a23bd4","observation_id":"ea67b4ea-26a7-4517-a771-8c6798774ba9","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.04675","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:58:32.625805Z","title":"Infini- tystar: Unified spacetime autoregressive modeling for visual generation","venue":null,"work_id":"e3d06309-1944-454b-be20-f4ffef259bf7","year":2025},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:081234f2b77388d14d4d13269fcfe8b246e03a820be647f089bea69788380d01","observation_id":"83e4063b-2ef3-431a-93ca-f2266ce8915c","resolution":{"observed_at":"2026-06-29T22:44:01.490406Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.20321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:09:50.827602Z","title":"Unitok: A unified tokenizer for visual generation and understanding.arXiv preprint arXiv:2502.20321, 2025a","venue":null,"work_id":"31d5c278-398d-4fee-8130-a864fb6b3717","year":2025},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:9647054e30f60e48957a8d74344c9e0a58afc42f0b87d5dd6eb0d4678c5292db","observation_id":"8b52e960-413c-4d03-9c8e-b2812c1f9336","resolution":{"observed_at":"2026-06-29T22:44:01.481719Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10797","last_updated":"2025-02-19T06:00:55Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-16T03:45:45Z","title":"STAR: Scale-wise Text-conditioned AutoRegressive image generation","version":4},"cited_work":{"arxiv_id":"2406.10797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10797","snapshot_observed_at":"2026-06-30T21:15:04.287215Z","title":"Star: Scale-wise text-conditioned autoregressive image generation","venue":null,"work_id":"d733178c-7a5e-45ae-afdd-15a8c247ed42","year":2024},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"cited_paper":"/paper/2406.10797","citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:e299560da5a6166268c4e38e402c4ee5d10409a816b1e818ac640477b8196338","observation_id":"7a37defd-297e-42c0-b33f-c85ea02ddd0d","resolution":{"observed_at":"2026-06-29T22:44:01.474030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Finite scalar quantization: VQ-V AE made simple","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:74a52e43f4664b1cb36ad92897946256d685a152f345377c58b4e3a898d82afa","observation_id":"83302f3f-2fab-4177-b933-a3a3cf8ec55f","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Randar: Decoder-only autoregressive visual generation in random orders","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:6ce6645b80866dbded52a626cb05823feef04d0c30b3f24c0f6d184961e45360","observation_id":"6de7f220-6157-4ad9-87a7-2d03a3dc402b","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis.The Twelfth International Conference on Learning Representations, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:53b3205af2be595cba9be5d75e6c913e9e8c126c6e83df371a398bbd62aa22bf","observation_id":"385fce98-6a59-43d2-8c3a-5786463f058b","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Tokenflow: Unified image tokenizer for multimodal understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:2d36856f191a1f08bd5ff6173c895781af1548a6cb3d7cf00080d8ffac6d15cd","observation_id":"d40d8fbb-c1ad-44b9-8a7e-3532c9c759c2","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Learning ordered representations with nested dropout","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:f38389f054ea94231b49192d44fa5cfd1441cc3cebd9fb4cc5c5c89b41a85a5b","observation_id":"6323503a-73c7-4391-880c-fe3bc36d5b8d","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Scalable image tokenization with index backpropagation quantization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:a7fbdb44e22c0b506ffd526fa9bbbad94e4bba2535bc1148bfc810db9d40551f","observation_id":"a2939349-d4fe-45ba-9edf-bd5941f82dd3","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14324","last_updated":"2026-04-20T17:55:12Z","snapshot_observed_at":"2026-08-02T12:34:37.994590Z","submitted_at":"2025-03-18T14:56:46Z","title":"DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies","version":3},"cited_work":{"arxiv_id":"2503.14324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.14324","snapshot_observed_at":"2026-07-04T10:09:44.696076Z","title":"DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies","venue":"cs.CV","work_id":"b7011dfc-3583-42ce-94ec-4dc9a84c02df","year":2025},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"cited_paper":"/paper/2503.14324","citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:460b3972609e01ece032d9bd6af33ce579e254f95bc3556c5c3012dae7f1b09d","observation_id":"2f137293-6aee-4727-90f0-7a28cb988c75","resolution":{"observed_at":"2026-06-29T22:44:01.476466Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":"2406.06525","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-07-10T11:37:03.266757Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","venue":"cs.CV","work_id":"41efe203-9377-4c63-b1d6-e499cd6e46f6","year":2024},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:26a6c9e8b8e8b8c431beb7a47e5377cd240a4fcc6a6f9d66d4c69beedca67997","observation_id":"64a2410f-7f28-4c27-8bd1-4119084bc62d","resolution":{"observed_at":"2026-06-29T22:44:01.471286Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Hart: Efficient visual generation with hybrid autore- gressive transformer.The Thirteenth International Conference on Learning Representations,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:b35c3b3040e084159ae0979abe495e88c7e1c0c2fa5db7335e70a763b43f841e","observation_id":"315b243f-f075-4dea-ace3-92ba40bb96fd","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":"2405.09818","doi":"10.48550/arxiv.2405.09818","metadata_source":"pith","pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","venue":"cs.CL","work_id":"2661b9a6-25cc-41a1-8100-612d2b801289","year":2024},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:3f4b435de40882c9b2294456f3cf426f0afbdd09f7b386ecfff25fa494be2921","observation_id":"bcea00a4-4113-42cb-886f-559d71d6d319","resolution":{"observed_at":"2026-06-29T22:44:01.468948Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10711","last_updated":"2025-08-18T15:55:23Z","snapshot_observed_at":"2026-08-05T20:12:05.144753Z","submitted_at":"2025-08-14T14:54:22Z","title":"NextStep-1: Toward Autoregressive Image Generation with Continuous Tokens at Scale","version":2},"cited_work":{"arxiv_id":"2508.10711","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10711","snapshot_observed_at":"2026-07-04T00:39:17.418338Z","title":"Nextstep-1: Toward autoregressive image generation with continuous tokens at scale","venue":null,"work_id":"729ea32c-8dd9-4636-a635-97e1ebb2dcd7","year":2025},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"cited_paper":"/paper/2508.10711","citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:85c436b5cd22f120270f13f191d4fe742f4f2cf90ed7fb53075b2d4713fa3be9","observation_id":"19dfa07d-2dbc-49ff-a6ca-17a5f9b46735","resolution":{"observed_at":"2026-06-29T22:44:01.484864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction.Advances in neural information processing systems, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:8a5bb4d895412ac75ae33206c1e78e01bd8f9427bca7ed30392f9c0ad56d0a7d","observation_id":"e61dec14-07a6-4593-a9d3-defa6fdebe0b","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:7a3b9c2681b4b441cfcd8f36e8f8f39c8c843fb06cbfeaaab389f377abbde666","observation_id":"aa4ab801-8aa8-4406-97be-7d05c3b1374f","resolution":{"observed_at":"2026-06-29T22:44:01.497938Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Neural discrete representation learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:5c8f54be782f9e3aa016dc5c095a798c7b8f1d4c74d8a8135057cbe153c343e3","observation_id":"5777cad5-6ed1-4017-8287-91cfc083e435","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Switti: Designing scale-wise transformers for text-to-image synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:c23122b17a57dbe3221bb87fd60638c8a4bc1c2541300bcffb580dedcf9ce129","observation_id":"e27fc053-a4f6-41a1-a85a-1c4bbef71f2c","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":"2409.18869","doi":"10.48550/arxiv.2409.18869","metadata_source":"pith","pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3: Next-Token Prediction is All You Need","venue":"cs.CV","work_id":"720d288e-fac0-464c-9929-19efd9a52afc","year":2024},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:e499eace10be9154e5a010af41836f9676c3e59f7b06f36069660af87dcedc32","observation_id":"8b8c3d18-92b6-44dd-a8d9-56aa6ba2d666","resolution":{"observed_at":"2026-06-29T22:44:01.493026Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Principal components","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:b2e68a818d25f9ad44262b8e519ba3f22acd802d1365bf26dc89955a882fbca3","observation_id":"10b76b22-5bbc-4062-b435-fcc1ee231a17","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2410.13848","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-07-04T10:19:47.348172Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","venue":"cs.CV","work_id":"8aa59998-5ac6-4ee1-bcb4-cf7fe479058b","year":2024},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:28fbe21c961b81c25a325b9ab36743d0694054bd724863cefea18cdab9807e92","observation_id":"e563c129-880c-4828-ade4-d99ff8b3696f","resolution":{"observed_at":"2026-06-29T22:44:01.495621Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Liquid: Language models are scalable and unified multi-modal generators","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:ffb6dac50f7d7c32ffe1fd619cd21307ae9d911d2b107b4affd41cbceee4b941","observation_id":"5eef5f86-a958-4f0f-924e-5dd265268aa1","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Vila-u: a unified foundation model integrating visual understanding and generation.The Thirteenth International Conference on Learning Representations, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:df9475d11510b728d661664b5381ddc8ad99703daac3a3a701e4c114cbee1d88","observation_id":"4dc9777a-b733-400b-866c-f8e1c526877c","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Sana: Efficient high-resolution image synthesis with linear diffusion transformers.The Thirteenth International Conference on Learning Representations, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:a63cdd86060a07f1a6f2456e12869efaa203f831445d6eb78fc9dc26b3177543","observation_id":"518f376c-f637-4554-bbec-262f840a8544","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":"2408.12528","doi":"10.48550/arxiv.2408.12528","metadata_source":"pith","pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","venue":"cs.CV","work_id":"1393dc24-a6b2-44e1-b5d7-7009d1fa4811","year":2024},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:31e9db7efc8d9a76548562e82bade8148646071bef400b2d89cef3b89a74aee6","observation_id":"dedd67dd-67a1-4060-857d-f90e62b4505a","resolution":{"observed_at":"2026-06-29T22:44:01.478776Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Muse-vl: Modeling unified vlm through semantic discrete encoding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:cb54e1b9a8e00c855139754f7c8f4fcee0cd88fcb3f6cc981e4c3f5b8aadd7c8","observation_id":"abe4463c-d527-45c4-923b-128724876907","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.11495","last_updated":"2021-02-23T05:13:16Z","snapshot_observed_at":"2026-08-06T01:09:42.969791Z","submitted_at":"2021-02-23T05:13:16Z","title":"Anytime Sampling for Autoregressive Models via Ordered Autoencoding","version":1},"cited_work":{"arxiv_id":"2102.11495","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.11495","snapshot_observed_at":"2026-06-29T22:44:01.513757Z","title":"Anytime sampling for autoregressive models via ordered autoencoding.arXiv preprint arXiv:2102.11495, 2021","venue":null,"work_id":"45af4036-fd2c-4d38-a28f-1a92538db458","year":2021},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"cited_paper":"/paper/2102.11495","citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:d089c667cd57b3473b0ae2b4e79ce2bb88ab960cf67d8222a739ef9f840b91f0","observation_id":"bb930f47-24bb-4aa4-ae0b-7a045cdf943c","resolution":{"observed_at":"2026-06-29T22:44:01.515429Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:bccd99f1a4cb7b40e3e5f8e4d230321261ef72607760959570ea1491c0f76773","observation_id":"12186e8d-900f-485b-8dc5-8c62ba360810","resolution":{"observed_at":"2026-06-29T22:44:01.466373Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Vector-quantized image modeling with improved vqgan","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:ff45b791719e221e4c3fdd5933dd75b2c747faca17344020e4824edd610c0e51","observation_id":"19626b4a-cc49-440b-b899-261fbbac2195","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Language model beats diffusion - tokenizer is key to visual generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:6ff2dad4cc380c5eb1e7b09aad21a60a612c75533544a96582a13eef24b29a64","observation_id":"b08c9a38-5391-44b8-a5f3-439b2e044ac5","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"An image is worth 32 tokens for reconstruction and generation.Advances in Neural Information Processing Systems, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:c5ffec4c5300e949d57c73286a932fa5ddee1eac79df959e6e8f93ce83b78eef","observation_id":"5f6a41cb-3330-4d86-9eef-fa429d2f0005","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Randomized au- toregressive visual generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:2dfa11beb502654ead6510eb4f07775bb6447ff0ea1195f3f9c5bc16c08fbed7","observation_id":"5c894afe-3774-46a5-9fa7-2f0d8f796a35","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"The unrea- sonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:db5b8ac821a0ce8f5c0c9975bb62fed0c1c25990fd513b18204f6fe7364f7cb6","observation_id":"78793e46-12f6-42f0-90da-ad212d7fd924","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Holistic tokenizer for autoregressive image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:0d5127d04c89e9241b50ba7435fbeb8c274df7e7847685f58ce6523b9ab63140","observation_id":"c36106c0-26ac-4405-aa5d-6c349cabd014","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Movq: Modulating quantized vectors for high-fidelity image generation.Advances in Neural Information Processing Systems, 35:23412–23425, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:ad0f1b2780edd9199f7d0b54007f7e4a8dcb310107045a9b540ed67ec4c29352","observation_id":"12c27c56-20f8-45d5-9cd9-1f2128e1c010","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Scaling the codebook size of vq-gan to 100,000 with a utilization rate of 99%","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:0d33d6b028b9aaaf6a825bc410e26e7492b5130bb7624e8a91b0a9b7d827f988","observation_id":"5679ca10-a25a-4e73-9a49-5ef692be0c91","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Addressing representation collapse in vector quantized models with one linear layer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:b9e5459a1f8710d69dbeabd0691205f633d204c37b9829d87ee0e5cd0add6599","observation_id":"9a26a862-a695-44e0-9beb-f48c231a8bd1","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02949","last_updated":"2025-04-03T18:06:28Z","snapshot_observed_at":"2026-07-06T21:03:55.628788Z","submitted_at":"2025-04-03T18:06:28Z","title":"VARGPT-v1.1: Improve Visual Autoregressive Large Unified Model via Iterative Instruction Tuning and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2504.02949","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.02949","snapshot_observed_at":"2026-07-04T13:39:51.514306Z","title":"Vargpt-v1.1: Improve visual autoregressive large unified model via iterative instruction tuning and reinforcement learning","venue":null,"work_id":"15564171-16c4-4f28-b29e-4128e0915967","year":2025},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"cited_paper":"/paper/2504.02949","citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:9f0f3d0835cad371192e84993d1dde05189fdeaff5e7568c774e7a0eb5e7b9ee","observation_id":"28fb7f48-9ed4-43ae-be87-a56507d34d44","resolution":{"observed_at":"2026-06-29T22:44:01.509628Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":"Lumina-next: Making lumina-t2x stronger and faster with next-dit.Advances in Neural Information Processing Systems, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:de9045530b7e765223aa11b2197a293432cbde8561431532f93df5faca68777e","observation_id":"66690027-74de-42ad-979c-9c63d672cfe5","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:05.761148Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:05.761148Z"},"links":{"citing_paper":"/paper/2605.26089"},"observation_digest":"sha256:edfe62a6dc95d117fda47a845370105d59aad4bbf17a9d99a4bc0b0699142b81","observation_id":"bc75725f-bc06-4197-a193-8ed5c7884ab7","resolution":{"observed_at":"2026-06-29T22:40:05.761148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.26089","last_updated":"2026-06-01T17:08:42Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T06:32:27.160770Z","submitted_at":"2026-05-25T17:52:08Z","title":"Channel-wise Vector Quantization"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":19,"verified_fuzzy":0},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 0 inbound Pith citation observations for arXiv:2605.26089."}