{"as_of":"2026-08-07T11:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a6920f3e7cfdf6811e06bec0afc1d60dd1c0f1af168a25bfe7e7a8fa21ac1f4a","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:32:54.917657Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T06:04:18.168577Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T15:17:07.216858Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07997","snapshot_observed_at":"2026-08-05T06:04:18.168577Z","title":"MGVQ: Could VQ-VAE beat VAE? a generalizable tokenizer with multi-group quantization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.07996","last_updated":"2026-07-20T17:34:32Z","snapshot_observed_at":"2026-08-07T09:38:31.708978Z","submitted_at":"2025-09-04T17:59:58Z","title":"3D and 4D World Modeling: A Survey","version":4},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-08-05T06:04:18.168577Z"},"links":{"cited_paper":"/paper/2507.07997","citing_paper":"/paper/2509.07996"},"observation_digest":"sha256:5f2e8378c90b9fb0de31622f627d4c278f273913e3b00bc23e3c3276d7e4fb41","observation_id":"7c01e3d7-73bc-4b35-a488-e6b6a6cfea42","resolution":{"observed_at":"2026-08-05T06:04:18.168577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"cited_work":{"arxiv_id":"2507.07997","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07997","snapshot_observed_at":"2026-07-02T15:17:07.216858Z","title":"arXiv preprint arXiv:2507.07997 (2025) 4, 7","venue":null,"work_id":"998b7447-d637-4bfa-a853-0f816138174f","year":2025},"citing_paper":{"arxiv_id":"2605.18115","last_updated":"2026-05-18T09:24:39Z","snapshot_observed_at":"2026-08-06T04:43:08.432770Z","submitted_at":"2026-05-18T09:24:39Z","title":"WinTok: A Win-Win Hybrid Tokenizer via Decomposing Visual Understanding and Generation with Transferable Tokens","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T12:04:19.761430Z"},"links":{"cited_paper":"/paper/2507.07997","citing_paper":"/paper/2605.18115"},"observation_digest":"sha256:51a877fb7f90c920d602b035b3bea48fa29b17783a9cce29e4a82362d8ae3674","observation_id":"50a07cdc-b07c-495d-98c9-64ee84f7d604","resolution":{"observed_at":"2026-05-20T12:08:15.852478Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"cited_work":{"arxiv_id":"2507.07997","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07997","snapshot_observed_at":"2026-07-02T15:17:07.216858Z","title":"arXiv preprint arXiv:2507.07997 (2025) 4, 7","venue":null,"work_id":"998b7447-d637-4bfa-a853-0f816138174f","year":2025},"citing_paper":{"arxiv_id":"2607.00371","last_updated":"2026-07-01T03:11:21Z","snapshot_observed_at":"2026-08-02T15:32:07.000409Z","submitted_at":"2026-07-01T03:11:21Z","title":"MEPA: Multi-Scale Representation Alignment for Visual Autoregressive Modeling with Mixture of Experts","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-02T15:14:36.946247Z"},"links":{"cited_paper":"/paper/2507.07997","citing_paper":"/paper/2607.00371"},"observation_digest":"sha256:8ae8ee4c8a76a82a41e0ca6cabd65398f9481bd329b990d56a1f2d5d05e07729","observation_id":"6d0577c1-f2bb-47c1-bb07-b7dfcc55092e","resolution":{"observed_at":"2026-07-02T15:17:07.218280Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07997","snapshot_observed_at":"2026-08-01T17:35:37.149410Z","title":"Mgvq: Could vq-vae beat vae? a generalizable tokenizer with multi-group quantization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17585","last_updated":"2026-07-22T07:24:13Z","snapshot_observed_at":"2026-08-06T07:20:20.809986Z","submitted_at":"2026-07-20T06:04:08Z","title":"Pixel-Space Diffusion Transformers","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-01T17:35:37.149410Z"},"links":{"cited_paper":"/paper/2507.07997","citing_paper":"/paper/2607.17585"},"observation_digest":"sha256:1811cdaedb70295e0557add2698f210a6a9bb321be61408e8472633c01f96d0f","observation_id":"1558fa2a-89c4-46f2-a51f-3476eed44741","resolution":{"observed_at":"2026-08-01T17:35:37.149410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.07997/citation-record","integrity":"/paper/2507.07997/integrity","json":"/paper/2507.07997/citation-record.json","paper":"/paper/2507.07997"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-06T18:32:54.656073Z","title":"Cosmos world foundation model platform for physical ai.arXiv preprint arXiv:2501.03575,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.656073Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:7e47b71d8129f28543bd3e9370f5328bc588a871f606a73501fe0278efe47a4a","observation_id":"fa25afe9-7edb-429d-bea0-1266cf94a24a","resolution":{"observed_at":"2026-08-06T18:32:54.656073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:59.388419Z","title":"Soft-to-hard vector quantization for end-to-end learn- ing compressible representations.NeurIPS, 30, 2017","venue":null,"work_id":"686eb123-2790-47fc-9d6a-c52f5b682004","year":2017},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.660807Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:273efa55cec0b4b9742a175afc7d32c8a5b9b68980cd0a15526e61aa86afe9e6","observation_id":"5b7de03b-ad22-4b2b-84fd-e3ee19e7b33f","resolution":{"observed_at":"2026-08-06T18:32:59.443908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16681","last_updated":"2024-11-27T17:04:36Z","snapshot_observed_at":"2026-07-06T19:56:43.637339Z","submitted_at":"2024-11-25T18:59:53Z","title":"Factorized Visual Tokenization and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16681","snapshot_observed_at":"2026-08-06T18:32:54.664956Z","title":"Factorized visual to- kenization and generation.arXiv preprint arXiv:2411.16681,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.664956Z"},"links":{"cited_paper":"/paper/2411.16681","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:b8ee032b53902f6c8ef4c8548a7a1461753527b7d00f7e469329e2c0ba57831e","observation_id":"1db8c4ea-d040-4ad5-b68b-0601ba76c886","resolution":{"observed_at":"2026-08-06T18:32:54.664956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1308.3432","last_updated":"2013-08-15T15:19:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-08-15T15:19:34Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1308.3432","snapshot_observed_at":"2026-08-06T18:32:54.669038Z","title":"Es- timating or propagating gradients through stochastic neurons for conditional computation.arXiv preprint arXiv:1308.3432,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.669038Z"},"links":{"cited_paper":"/paper/1308.3432","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:c6df494a756fa540cc79924519d73522b3b7df915bf1c17e64d1b620825f588a","observation_id":"73144590-faef-4b83-b582-dbee1ea9afa8","resolution":{"observed_at":"2026-08-06T18:32:54.669038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:59.263241Z","title":"Matryoshka multimodal models","venue":null,"work_id":"b8f67e94-0186-4951-8496-7ef59545cb6a","year":2024},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.673680Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:6aa5af49ad009e11e5ac66064b17cb52d885013d4b7b985bfaa922be32f4e88d","observation_id":"ab12f06f-5158-48ec-a2a1-c0bcf23d67e2","resolution":{"observed_at":"2026-08-06T18:32:59.328799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10733","last_updated":"2025-05-18T21:17:22Z","snapshot_observed_at":"2026-07-06T19:33:12.610676Z","submitted_at":"2024-10-14T17:15:07Z","title":"Deep Compression Autoencoder for Efficient High-Resolution Diffusion Models","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10733","snapshot_observed_at":"2026-08-06T18:32:54.677511Z","title":"Deep com- pression autoencoder for efficient high-resolution diffusion models.arXiv preprint arXiv:2410.10733, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.677511Z"},"links":{"cited_paper":"/paper/2410.10733","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:b5e0aac248f906d8615b54fcfb62bbc98fe8ad40556e5866e8013296db7dcf9e","observation_id":"60620f36-263c-4d3e-951e-ba897c60f8f8","resolution":{"observed_at":"2026-08-06T18:32:54.677511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01199","last_updated":"2024-09-09T13:49:53Z","snapshot_observed_at":"2026-08-06T07:02:56.982714Z","submitted_at":"2024-09-02T12:20:42Z","title":"OD-VAE: An Omni-dimensional Video Compressor for Improving Latent Video Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01199","snapshot_observed_at":"2026-08-06T18:32:54.681958Z","title":"Od- vae: An omni-dimensional video compressor for improving la- tent video diffusion model.arXiv preprint arXiv:2409.01199,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.681958Z"},"links":{"cited_paper":"/paper/2409.01199","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:f7bc6e74229e32d33913abd027f13a03c53c944af75eb454c24f5adf92e85ed4","observation_id":"13f3989c-7f60-4ab6-ad48-f535f1370eac","resolution":{"observed_at":"2026-08-06T18:32:54.681958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15807","last_updated":"2023-09-27T17:30:19Z","snapshot_observed_at":"2026-08-02T11:54:13.342379Z","submitted_at":"2023-09-27T17:30:19Z","title":"Emu: Enhancing Image Generation Models Using Photogenic Needles in a Haystack","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15807","snapshot_observed_at":"2026-08-06T18:32:54.685858Z","title":"Emu: Enhancing image generation models using photogenic needles in a haystack","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.685858Z"},"links":{"cited_paper":"/paper/2309.15807","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:7c96dd5938cb13c1105e97c514402531fb3e107419811f4a7197f6df976d0f9e","observation_id":"ad80db0c-8681-4203-a2f1-25d1571e2008","resolution":{"observed_at":"2026-08-06T18:32:54.685858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:59.106929Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"d9e75378-1915-4458-9f3c-0aa878c21fb0","year":2009},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.690564Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:470e83d2a21a51b1e25f0b0e804b29fd8b44ac5b00cb424d8f5b09252fdaf73c","observation_id":"0853d326-2f4d-46cb-be17-f8307673a8f8","resolution":{"observed_at":"2026-08-06T18:32:59.208196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:58.763113Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":"c4d50e38-5a41-48cd-b3f5-e2066e097bbd","year":2021},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.694469Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:4948c24cbb8e114af5c009cb378ec14451450fecbaadaaaa267f236980877d5b","observation_id":"2fe171f0-ce4b-46ce-b09c-176e1b3af673","resolution":{"observed_at":"2026-08-06T18:32:58.960457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:54.698515Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.698515Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:bb002c2c5f1dff65162703d3ce6b5a06a148bae5b463c4c8e027d53ec1975c48","observation_id":"c20128ec-3ad6-4173-9dda-f5995c92a6ca","resolution":{"observed_at":"2026-08-06T18:32:54.698515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.12595","last_updated":"2022-07-04T16:11:08Z","snapshot_observed_at":"2026-07-06T09:50:54.221387Z","submitted_at":"2020-08-28T11:49:33Z","title":"Dynamical Variational Autoencoders: A Comprehensive Review","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.12595","snapshot_observed_at":"2026-08-06T18:32:54.702241Z","title":"Dynamical variational autoencoders: A comprehensive review.arXiv preprint arXiv:2008.12595, 2020","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.702241Z"},"links":{"cited_paper":"/paper/2008.12595","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:f64804332173686d33728bf2e630e10ce58a8563f3c0a356324a4234b5773de8","observation_id":"315bc44b-6ed5-477e-a8ff-d4bcc06c5242","resolution":{"observed_at":"2026-08-06T18:32:54.702241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:58.158018Z","title":"Vector quantization.IEEE Assp Magazine, 1 (2):4–29, 1984","venue":null,"work_id":"d7f61526-7082-48a0-b11a-0bf11e6efa85","year":1984},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.705855Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:08f775e8d6a1244061e350a20d3e4a3a486529b242be747bc0211c9a2dcd84ee","observation_id":"714d8be0-2def-43b2-829d-a69759ee7259","resolution":{"observed_at":"2026-08-06T18:32:58.461691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10429","last_updated":"2024-10-14T12:24:32Z","snapshot_observed_at":"2026-07-06T19:33:00.110753Z","submitted_at":"2024-10-14T12:24:32Z","title":"DOME: Taming Diffusion Model into High-Fidelity Controllable Occupancy World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10429","snapshot_observed_at":"2026-08-06T18:32:54.709837Z","title":"Dome: Tam- ing diffusion model into high-fidelity controllable occupancy world model.arXiv preprint arXiv:2410.10429, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.709837Z"},"links":{"cited_paper":"/paper/2410.10429","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:2400286e83ce1c3357a10c44e76de209546a060083b497d37f0649d04533eb63","observation_id":"e7e61a31-cdb8-44f3-9958-9a1053b31b4c","resolution":{"observed_at":"2026-08-06T18:32:54.709837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09755","last_updated":"2025-01-16T18:59:04Z","snapshot_observed_at":"2026-07-06T20:22:09.358394Z","submitted_at":"2025-01-16T18:59:04Z","title":"Learnings from Scaling Visual Tokenizers for Reconstruction and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09755","snapshot_observed_at":"2026-08-06T18:32:54.714314Z","title":"Learnings from scaling visual tokenizers for reconstruction and generation.arXiv preprint arXiv:2501.09755, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.714314Z"},"links":{"cited_paper":"/paper/2501.09755","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:7f72e19ab57fa748063756fcc446c1800441514e80b6edd0b61a1748614e685b","observation_id":"09dadb60-9087-4483-9174-0060d7155eec","resolution":{"observed_at":"2026-08-06T18:32:54.714314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19505","last_updated":"2024-12-30T09:08:12Z","snapshot_observed_at":"2026-07-06T20:13:36.042546Z","submitted_at":"2024-12-27T07:44:07Z","title":"DrivingWorld: Constructing World Model for Autonomous Driving via Video GPT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19505","snapshot_observed_at":"2026-08-06T18:32:54.718781Z","title":"Driving- world: Constructingworld model for autonomous driving via video gpt.arXiv preprint arXiv:2412.19505, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.718781Z"},"links":{"cited_paper":"/paper/2412.19505","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:b73138a153dc5e28929c11d85c347c3bfd54c0b8c67bee9be75c74ecd06da887","observation_id":"b2409850-6265-41af-87aa-044ac4955e59","resolution":{"observed_at":"2026-08-06T18:32:54.718781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:57.733228Z","title":"Image-to-image translation with conditional adversarial net- works","venue":null,"work_id":"5f75d770-2b21-49fc-b786-eeece1ac41de","year":2017},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.722500Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:bcea26b65396fa03f282332b3c1559ee76fcd150b373ef1119e62a90efa7a620","observation_id":"0cd1d0cf-b270-4830-9e69-42eba91510b7","resolution":{"observed_at":"2026-08-06T18:32:57.890039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:57.542136Z","title":"A style-based generator architecture for generative adversarial networks","venue":null,"work_id":"afeba96b-dac6-4201-8d6e-ae93c27360c1","year":2019},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.725903Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:3e970af4caf9b1a7e2fca7b8a6f41b657c502f865215692c5242412819aa14ca","observation_id":"f9c740e7-39c0-402e-aaf7-f78ff48e811b","resolution":{"observed_at":"2026-08-06T18:32:57.609403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:57.415522Z","title":"Auto-encoding variational bayes, 2013","venue":null,"work_id":"2efcd78c-df52-4837-9f43-8599b875fe49","year":2013},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.729894Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:0ccd22f799a8c70aed0a18eb8f55a3cbe6450541bf973b976f0b5e1f072cb25f","observation_id":"5ea2efee-035c-49b7-9d10-f9c4a91f1059","resolution":{"observed_at":"2026-08-06T18:32:57.480027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:57.245530Z","title":"An introduction to variational autoencoders.Foundations and Trends® in Machine Learning, 12(4):307–392, 2019","venue":null,"work_id":"cc79c669-627c-4058-b5b5-51897ba1edec","year":2019},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.734039Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:5099e956f6f62a5e485e6f28026788cc111d9a4df07c537284529443f7b38fcd","observation_id":"712101f3-ed72-41ae-b32a-7cea93161efd","resolution":{"observed_at":"2026-08-06T18:32:57.301948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:57.043859Z","title":"Segment any- thing","venue":null,"work_id":"ab5349e8-0d81-45bb-9da7-2eaff57686a8","year":2023},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.737315Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:cd95fea76e9ecf7b4f557b3c69afc2391590d203794cf9b3929c8402516c5f7c","observation_id":"2dd59af8-2886-428e-aca6-dcc8275690c2","resolution":{"observed_at":"2026-08-06T18:32:57.125356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:56.882684Z","title":"Matryoshka representation learning.NeurIPS, 35: 30233–30249, 2022","venue":null,"work_id":"a4a7d3ea-9152-4ab0-bcaa-52d50bfa6bd2","year":2022},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.740846Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:b079433a05920a1ea5ce5a4f4095783a69cad60f49a18e1c9d65ca52d6271005","observation_id":"19961738-1c1f-45e5-9d4e-de689cdf467a","resolution":{"observed_at":"2026-08-06T18:32:56.927856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:56.737490Z","title":null,"venue":null,"work_id":"790c82fa-3d6c-4c8c-9821-208da0186821","year":1956},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.745046Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:12030c317e99d8ec6268a498707fba2e8304ba7d003aca51f5962a88b4b66bf0","observation_id":"9ec191dc-30e3-4ba6-8aa4-6aaf25833d39","resolution":{"observed_at":"2026-08-06T18:32:56.808049Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:56.554756Z","title":"Fast and accurate image super-resolution with deep laplacian pyramid networks.PAMI, 41(11):2599–2613,","venue":null,"work_id":"5e9b0158-1036-426c-b15d-794ee9a4234d","year":null},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.748505Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:960b616bbb939118b426b425dd2d68c01b89743935fcf8ceec0b383a1fbc94c6","observation_id":"32561895-2f25-4185-9655-7f12963d76ad","resolution":{"observed_at":"2026-08-06T18:32:56.646310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:56.390922Z","title":"Autoregressive image generation using resid- ual quantization","venue":null,"work_id":"cedddeb3-3a1e-41a7-be5c-1f8e07bd81b8","year":2022},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.751988Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:80b10e56c84d89cd0f914c44bcb24944c4b19ea4ff421fb67fdd4075840a9d7c","observation_id":"316f5cee-0dbc-474a-97ad-46deae0cb0e4","resolution":{"observed_at":"2026-08-06T18:32:56.476819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.09067","last_updated":"2022-03-17T03:53:11Z","snapshot_observed_at":"2026-08-06T05:06:11.465108Z","submitted_at":"2022-03-17T03:53:11Z","title":"UNIMO-2: End-to-End Unified Vision-Language Grounded Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.09067","snapshot_observed_at":"2026-08-06T18:32:54.755656Z","title":"Unimo-2: End-to- end unified vision-language grounded learning.arXiv preprint arXiv:2203.09067, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.755656Z"},"links":{"cited_paper":"/paper/2203.09067","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:e98be22df977370132efb1bcde1f81f1ab78a28e281191c6ccc83cd85df5eaaf","observation_id":"7b2b4650-5df9-4f6d-9f0b-f383f0ea5116","resolution":{"observed_at":"2026-08-06T18:32:54.755656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:54.759630Z","title":"Efficient neural radiance fields for interactive free-viewpoint video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.759630Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:69a05a8c6f44dc986cb34be80d1214f3d4df7f459a677f05da0a1f59838ad99d","observation_id":"ff678a4e-6db6-4a6c-b363-e2ab9266e367","resolution":{"observed_at":"2026-08-06T18:32:54.759630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.05438","last_updated":"2021-06-10T00:23:33Z","snapshot_observed_at":"2026-07-06T11:17:47.803564Z","submitted_at":"2021-06-10T00:23:33Z","title":"Cross-Modal Discrete Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.05438","snapshot_observed_at":"2026-08-06T18:32:54.763435Z","title":"Cross- modal discrete representation learning.arXiv preprint arXiv:2106.05438, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.763435Z"},"links":{"cited_paper":"/paper/2106.05438","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:2faf3e3ae87fa4fce3b0da23c09d290c9562ddbcfd0132abee86d5b9611426f6","observation_id":"ba18f4d1-3c5f-4941-b526-26759292792e","resolution":{"observed_at":"2026-08-06T18:32:54.763435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:56.205154Z","title":null,"venue":null,"work_id":"150cb642-df1a-4c48-8176-f7b2b27cba4d","year":2020},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.767670Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:8847d460ec4e4d610ea79b38ea3aea712e95eb7fc0ecd483a6fb90e126eaa389","observation_id":"321fcf6e-1492-40df-8db0-df32a3211422","resolution":{"observed_at":"2026-08-06T18:32:56.305892Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:56.015350Z","title":"Deep learning face attributes in the wild","venue":null,"work_id":"3f6a96df-4ce8-4298-b210-84c085baf19c","year":2015},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.771152Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:d6839ae556047743453d9fc69fbdb4492aee8f3ee4ecc8262165558fc8682942","observation_id":"72b9924d-a73a-4392-a3ce-4618461792b4","resolution":{"observed_at":"2026-08-06T18:32:56.099536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T18:32:54.774843Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.774843Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:62774c105789e2482ef400940fbdd1ae9775f675e9f8328301622cc1b7233b8d","observation_id":"647f1e06-3d2c-4b8f-a764-65e6e8fdb115","resolution":{"observed_at":"2026-08-06T18:32:54.774843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04410","last_updated":"2025-02-09T08:59:19Z","snapshot_observed_at":"2026-08-06T03:43:29.067278Z","submitted_at":"2024-09-06T17:14:53Z","title":"Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04410","snapshot_observed_at":"2026-08-06T18:32:54.777950Z","title":"Open-magvit2: An open-source project toward democratizing auto-regressive visual generation.arXiv preprint arXiv:2409.04410, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.777950Z"},"links":{"cited_paper":"/paper/2409.04410","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:1c1c74ec12597fd256aed2f4fddca2a77d47bff294730996d4e8ed5d619fb2ec","observation_id":"347ad2ab-9c45-40af-8a5f-7dd349dc16bc","resolution":{"observed_at":"2026-08-06T18:32:54.777950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.914010Z","title":"Uavid: A semantic segmentation dataset for uav imagery.ISPRS journal of photogrammetry and remote sensing, 165:108–119, 2020","venue":null,"work_id":"96d1671e-8c4c-4edd-b238-10371d116131","year":2020},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.782317Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:86b72ddb2fb6336c00537c99f90a1691f748f72e429b5932dddbf30e9ef748de","observation_id":"ab303b49-c4e5-4430-a397-1d2fc7294130","resolution":{"observed_at":"2026-08-06T18:32:55.941806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:54.785868Z","title":"Unitok: A unified tokenizer for visual generation and understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.785868Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:0f62f8d07712627370925dd3024f37444bc08fc7b19c02557fcf2d3cc6bd05e7","observation_id":"97bf4447-1ff3-4ff4-ae8c-00041e1622a6","resolution":{"observed_at":"2026-08-06T18:32:54.785868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.10493","last_updated":"2022-04-02T01:51:00Z","snapshot_observed_at":"2026-08-01T16:09:20.588590Z","submitted_at":"2021-11-20T01:49:56Z","title":"Discrete Representations Strengthen Vision Transformer Robustness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.10493","snapshot_observed_at":"2026-08-06T18:32:54.789146Z","title":"Discrete representations strengthen vision transformer robustness.arXiv preprint arXiv:2111.10493, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.789146Z"},"links":{"cited_paper":"/paper/2111.10493","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:7ebb0da615cec40e82569b3e0476c536e27e406bfa92ae91ef1125560221ff0a","observation_id":"ed12b8b9-3f68-430a-bc32-cfeb824a45de","resolution":{"observed_at":"2026-08-06T18:32:54.789146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.877198Z","title":"Spring: A high-resolution high- detail dataset and benchmark for scene flow, optical flow and stereo","venue":null,"work_id":"3f9b923c-c4dc-4359-a59a-ae7333243523","year":2023},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.792581Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:ece3bfd1b793571921bbe24d56f581c3fb595daaed1b5e04031eaae5ed7224ba","observation_id":"64b59686-6c1c-448a-ba6f-c15b1167db52","resolution":{"observed_at":"2026-08-06T18:32:55.898329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-07-06T16:24:17.829828Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15505","snapshot_observed_at":"2026-08-06T18:32:54.796784Z","title":"Finite scalar quantization: Vq-vae made simple.arXiv preprint arXiv:2309.15505, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.796784Z"},"links":{"cited_paper":"/paper/2309.15505","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:eaaf7ad27193790fb252c682ab638c435be52e8147b3bf3a50baadebbdfd22fa","observation_id":"c95d37b3-2ce2-47c8-aaff-35cb4c325d29","resolution":{"observed_at":"2026-08-06T18:32:54.796784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.842998Z","title":"The mapillary vistas dataset for semantic understanding of street scenes","venue":null,"work_id":"46b823b2-89a1-4e1d-ab9a-de2cdfbde0c9","year":null},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.800707Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:55db446e88c6cd86001a11fac80d5a57556bca5b98fc715fb86bb427ff07b68c","observation_id":"b279fdcf-2ce6-4b99-9524-7cdf3d08bd4b","resolution":{"observed_at":"2026-08-06T18:32:55.856664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.819036Z","title":"A benchmark dataset and evaluation methodology for video object segmentation","venue":null,"work_id":"acd26b3d-de60-40da-aa3f-9fc998688585","year":2016},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.804031Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:e79fbf1d2863882da40ee810567f66c2fd52637ac97b381db6bdb2d5224ca2f9","observation_id":"70b7f29d-03c4-4a4b-a944-87732a6e207e","resolution":{"observed_at":"2026-08-06T18:32:55.828149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-06T18:32:54.807968Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.807968Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:1baddf819044adb3c18494e8b3d35d3bc966c95e19a000b6f00e9a361e306d29","observation_id":"7577d47b-25be-48c2-a497-548f77383735","resolution":{"observed_at":"2026-08-06T18:32:54.807968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.791916Z","title":"Generat- ing diverse high-fidelity images with vq-vae-2.NeurIPS, 32,","venue":null,"work_id":"db0259c3-a9a9-4ce3-9e94-944f3235d4e4","year":null},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.811754Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:98cf4297803626f4b293f694b72eb7dcb64a327017d13aa9ae41209a0187dca3","observation_id":"c88a31c9-75f5-4cec-b0c6-e5e6160df8fe","resolution":{"observed_at":"2026-08-06T18:32:55.803913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.767151Z","title":"Learning ordered representations with nested dropout","venue":null,"work_id":"465f6b12-e691-461c-8b81-bf2eb52eecf5","year":2014},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.815370Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:a2091112a951a0b5d43d2ed57471cc27393f3c5a46d2f42784ab3e2f118d07cc","observation_id":"6ce2731a-ee8f-41b6-8911-4198a98b8c59","resolution":{"observed_at":"2026-08-06T18:32:55.776776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.741296Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"2146f01b-07cd-4258-b0b5-97137ce3ba4f","year":2022},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.819227Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:cab45fb56711a305ec230ef0245965f1cb44cbb152e513b161267dc0a0107ac3","observation_id":"ca12fda3-c56f-40d9-9efa-7ca4c4c2721f","resolution":{"observed_at":"2026-08-06T18:32:55.751750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.717686Z","title":"Laion-5b: An open large-scale dataset for training next gener- ation image-text models.NeurIPS, 35:25278–25294, 2022","venue":null,"work_id":"94438448-f718-4034-b943-43acc47358d9","year":2022},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.822684Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:4a9cd8a5586e0303009b47532d9a54ed41849c08a5b2c3bd1dd6003de6d0d7dc","observation_id":"06ec731d-8a51-4ebd-ad68-1c92be8d4a7b","resolution":{"observed_at":"2026-08-06T18:32:55.727962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.686901Z","title":"Textocr: Towards large- scale end-to-end reasoning for arbitrary-shaped scene text","venue":null,"work_id":"7e3e0ef8-59b9-4c83-b564-9823e73c2267","year":2021},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.826198Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:aa8351e70886a9d6957ac000e9f5de4472869ca02d9135e66af63a265c1ac3e9","observation_id":"27a94147-c20e-44b9-932b-174afb033e8b","resolution":{"observed_at":"2026-08-06T18:32:55.700458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-06T18:32:54.829422Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation.arXiv preprint arXiv:2406.06525, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.829422Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:c6952ee3ecf3ffb0c0edf674a53bb7e39615717fb8f3bab9dba8764b83ab379c","observation_id":"28cfce01-97c4-4b8a-8837-c762e5680455","resolution":{"observed_at":"2026-08-06T18:32:54.829422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.07547","last_updated":"2022-06-09T12:46:05Z","snapshot_observed_at":"2026-07-06T13:10:16.795009Z","submitted_at":"2022-05-16T09:49:37Z","title":"SQ-VAE: Variational Bayes on Discrete Representation with Self-annealed Stochastic Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.07547","snapshot_observed_at":"2026-08-06T18:32:54.833870Z","title":"Sq-vae: Variational bayes on discrete representation with self-annealed stochastic quantization.arXiv preprint arXiv:2205.07547, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.833870Z"},"links":{"cited_paper":"/paper/2205.07547","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:ba6762a6baf0ce1b9a83c2433780804bc4d3894ee6ec503c2c9d01aad822da81","observation_id":"40a081a7-63f0-4cb5-8680-99722b6c2972","resolution":{"observed_at":"2026-08-06T18:32:54.833870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:54.837875Z","title":"Visual autoregressive modeling: Scalable image gen- eration via next-scale prediction.NeurIPS, 37:84839–84865,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.837875Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:a57e38a496df3fdf819ffeec7774e555741c81b508bcf91bbe02a66ca0b4a0fb","observation_id":"9a9cddf8-38a7-49d4-879d-6c3057efc929","resolution":{"observed_at":"2026-08-06T18:32:54.837875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.660351Z","title":"Neural discrete representation learning.NeurIPS, 30, 2017","venue":null,"work_id":"21cf6fea-6b85-4ccd-8cb9-fd72796490ee","year":2017},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.841691Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:fbc8977d13c5bd7c386069bcacf2c884613697ba9715a929db950f068ed10933","observation_id":"4f8bda5d-705c-4e97-a293-282fcb0252d7","resolution":{"observed_at":"2026-08-06T18:32:55.666141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.643824Z","title":"Neural discrete representation learning.NeurIPS, 30, 2017","venue":null,"work_id":"9621b2cb-070c-4859-90b4-5a630b250145","year":2017},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.844866Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:d56c09e08753672eafaedb327e9ec4d8cb9435768d83a52a10f7ed620935fd26","observation_id":"87156a6f-4d3f-4d15-8228-ab7bc6faf0bd","resolution":{"observed_at":"2026-08-06T18:32:55.649860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-06T18:32:54.848969Z","title":"Emu3: Next-token prediction is all you need.arXiv preprint arXiv:2409.18869, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.848969Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:2e137cf84340400b587e0a3173813a8b361709b13922aa752bb0170c03feedee","observation_id":"9f4df827-a6c2-4f73-ae71-269af5e4a0aa","resolution":{"observed_at":"2026-08-06T18:32:54.848969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.629830Z","title":"Hierarchical quantized autoen- coders.NeurIPS, 33:4524–4535, 2020","venue":null,"work_id":"515816d6-1086-445e-906f-a45360317d09","year":2020},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.852737Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:e3a3610d3f7454921d66c0cb6270b225731ca4e2619ec0e1ad0e286db81084e0","observation_id":"afde9047-e48c-4259-b06e-a2df617f554c","resolution":{"observed_at":"2026-08-06T18:32:55.635306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00493","last_updated":"2023-01-02T00:36:22Z","snapshot_observed_at":"2026-07-06T14:36:37.805357Z","submitted_at":"2023-01-02T00:36:22Z","title":"Argoverse 2: Next Generation Datasets for Self-Driving Perception and Forecasting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00493","snapshot_observed_at":"2026-08-06T18:32:54.855897Z","title":"Argoverse 2: Next generation datasets for self-driving perception and forecasting.arXiv preprint arXiv:2301.00493,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.855897Z"},"links":{"cited_paper":"/paper/2301.00493","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:217f94298d5b35fec8aebbef6a377b663afc87167a1f0af8e9dd947382f49c73","observation_id":"7c3cf0e3-1857-480f-bcf5-a3b6e53a1634","resolution":{"observed_at":"2026-08-06T18:32:54.855897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.614081Z","title":"Vfhq: A high-quality dataset and benchmark for video face super-resolution","venue":null,"work_id":"5fa1eb5a-3996-45c5-acdf-5c017b9d15c6","year":null},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.860072Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:0f51bb44be1ca4e1f01b1ac40e6e65f1e6e50aae1689db6dcc9f38991ed99f72","observation_id":"aa95dc1f-7246-4bbf-8cfa-369e5b8ff5ff","resolution":{"observed_at":"2026-08-06T18:32:55.620759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-06T18:32:54.863560Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer.arXiv preprint arXiv:2408.06072, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.863560Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:82b1d25b69910b3d9bf85bd29f1c4d8e3c1342b8ee4ce99c9597d2e89b9a5f42","observation_id":"c1f1d8ef-2e58-4930-a484-411149d45c7c","resolution":{"observed_at":"2026-08-06T18:32:54.863560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.598362Z","title":"Locally hierarchical auto-regressive modeling for image generation.NeurIPS, 35:16360–16372, 2022","venue":null,"work_id":"5b314490-2eaf-4030-bd97-db49b8893cd1","year":2022},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.869276Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:cef0cb0ce84629a839b53d5a00e12022bb2c33f4444badaa050afce9f3c7de78","observation_id":"66b9ce63-49de-4252-b813-124bb11a5af3","resolution":{"observed_at":"2026-08-06T18:32:55.603667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04627","last_updated":"2022-06-05T01:57:58Z","snapshot_observed_at":"2026-07-06T11:56:10.689708Z","submitted_at":"2021-10-09T18:36:00Z","title":"Vector-quantized Image Modeling with Improved VQGAN","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04627","snapshot_observed_at":"2026-08-06T18:32:54.876303Z","title":"Vector-quantized image modeling with improved vqgan.arXiv preprint arXiv:2110.04627, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.876303Z"},"links":{"cited_paper":"/paper/2110.04627","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:f7e826c309675c0e33581fba22ef7e3c7f87b82352c5a100d3113ed52fe04e6c","observation_id":"eab746ae-7afe-4f7d-b606-10734b7b2069","resolution":{"observed_at":"2026-08-06T18:32:54.876303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-06T18:32:54.880493Z","title":"Language model beats diffusion–tokenizer is key to visual generation.arXiv preprint arXiv:2310.05737, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.880493Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:e02152a4b5a3201866af00b878b363ad81152ca31684c17130fa656059c45312","observation_id":"1ff981d7-ad2d-42ce-ad33-c26c8cede6ef","resolution":{"observed_at":"2026-08-06T18:32:54.880493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.585000Z","title":"Towards efficient and scale-robust ultra- high-definition image demoir´eing","venue":null,"work_id":"906c15ea-1224-4f30-948c-0494bc8dcc99","year":2022},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.884092Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:359c0405571919ddf28a47812c256dccd255980ef6fe68995552d0b8bab88e97","observation_id":"bf266951-c957-4104-b4b0-97c5c85a392a","resolution":{"observed_at":"2026-08-06T18:32:55.589930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.570229Z","title":"Towards high-resolution salient object detection","venue":null,"work_id":"d0922ae1-6e43-443f-8c43-6ffd4b7dc617","year":2019},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.888095Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:0c52cd75baee5d7810e1908ba95f4a02522e99529197401013e55123a141ef4a","observation_id":"0db0ce1f-929a-48cd-880c-256d4cacfda7","resolution":{"observed_at":"2026-08-06T18:32:55.576020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.551189Z","title":"Regularized vector quantization for tokenized image synthesis","venue":null,"work_id":"e009f64f-78cc-4d33-8b8d-ec5a3ca16fde","year":2023},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.891292Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:9bc81ba163226cde842689d03c82d6fa81c59cdf92bf9c257ab89223b333a5d5","observation_id":"8bf75040-ee6a-49ed-8862-c2b5f3e60716","resolution":{"observed_at":"2026-08-06T18:32:55.558567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24113","last_updated":"2025-06-30T17:56:35Z","snapshot_observed_at":"2026-08-06T21:21:34.254944Z","submitted_at":"2025-06-30T17:56:35Z","title":"Epona: Autoregressive Diffusion World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.24113","snapshot_observed_at":"2026-08-06T18:32:54.894607Z","title":"Epona: Autoregressive dif- fusion world model for autonomous driving.arXiv preprint arXiv:2506.24113, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.894607Z"},"links":{"cited_paper":"/paper/2506.24113","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:6d2d73d44e3e369fda6d27a4a418763d0648016584d0bc752fcd6598aa8fbe28","observation_id":"82e6a31f-dead-4d43-86a6-b2abc9cee4a0","resolution":{"observed_at":"2026-08-06T18:32:54.894607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:54.898803Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.898803Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:84523d07f179c0fb473b9a7198c4b88c67ea0f600ff27f2ee04ace054d472549","observation_id":"855632f1-6695-4218-8881-46c01f201e12","resolution":{"observed_at":"2026-08-06T18:32:54.898803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.410562Z","title":"Cv-vae: A compatible video vae for latent generative video models","venue":null,"work_id":"36e9935c-3b2f-4db1-b527-c87ac22c8459","year":2025},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.902299Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:699d304df26af0974f93df32e18050fa65ae9551b3289a176dd5ce142412e9d4","observation_id":"e8fbd35c-11c8-4da4-b460-e2b025f7ddd7","resolution":{"observed_at":"2026-08-06T18:32:55.418337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.395173Z","title":"Online clustered code- book","venue":null,"work_id":"deb0d713-98e0-4e81-899d-0503c4e25396","year":2023},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.905936Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:e863296685b9da00d7aeec3cca86927f43e752715b821d9b4940073f8e59df2f","observation_id":"a92fa275-1fe5-4b84-a263-7b0c0fc36a67","resolution":{"observed_at":"2026-08-06T18:32:55.401129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.378426Z","title":"Movq: Modulating quantized vectors for high-fidelity image generation.NeurIPS, 35:23412–23425, 2022","venue":null,"work_id":"cd1bda08-130c-4c96-9e49-8f87652af1bb","year":2022},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.909403Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:510093a7de11803220dbcc6b31f2796e96863f115e46ae0872742ac731f00c39","observation_id":"c29cddbf-4fe0-4516-b321-610f054d3e54","resolution":{"observed_at":"2026-08-06T18:32:55.386177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20404","snapshot_observed_at":"2026-08-06T18:32:54.914113Z","title":"Open-sora: Democratizing efficient video production for all.arXiv preprint arXiv:2412.20404, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.914113Z"},"links":{"cited_paper":"/paper/2412.20404","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:0c0280625f4b99893dd9a532c2551110a2f5f99786e74fc425b791c3f8968d43","observation_id":"7f52d659-5b7f-457e-b2ad-958dc16b605f","resolution":{"observed_at":"2026-08-06T18:32:54.914113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:54.917657Z","title":"Address- ing representation collapse in vector quantized models with one linear layer.arXiv preprint arXiv:2411.02038, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.917657Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:31587d6c688515029da1dded8065783b456385fa3e83774ffe5c4fbd83bb6ae7","observation_id":"4b2cd5b7-117a-40be-a8df-9ee90f0ca735","resolution":{"observed_at":"2026-08-06T18:32:54.917657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T18:25:28.975585Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":34},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 4 inbound Pith citation observations for arXiv:2507.07997."}