{"as_of":"2026-08-08T17:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c0b9f78203da69e5d24d166648d93becb9575a181af32ba49c2fca3de88a49db","coverage":[{"denominator":122,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:24:49.346598Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05798/citation-record","integrity":"/paper/2608.05798/integrity","json":"/paper/2608.05798/citation-record.json","paper":"/paper/2608.05798"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.884725Z","title":"Bitdance: Scaling autoregressive generative models with binary tokens, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.884725Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:60241458f4f1a177832d0e595112373a3f2a2aa6779eaed63f3f47ac2b32259b","observation_id":"738a38b0-545f-4185-a25e-5273ff6c1ee1","resolution":{"observed_at":"2026-08-07T23:24:48.884725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.890347Z","title":"OmniDoc-TokenBench","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.890347Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:bbcb690e7ffa5c5e03d7926a8915a976a4c9b1f59cc37731df309bf993635851","observation_id":"2cf5ec29-295d-4960-8f0d-451f2c896b44","resolution":{"observed_at":"2026-08-07T23:24:48.890347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.895514Z","title":"AOM Common Test Conditions v5.0","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.895514Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:83a344b40a07f495ce1dc1b0226d3f454cfeb9b27e258e353fb8c7752227c4a9","observation_id":"58e03af8-44a4-4176-9f42-fb71009e891d","resolution":{"observed_at":"2026-08-07T23:24:48.895514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.900423Z","title":"Kandinsky 5.0: A family of foundation models for image and video generation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.900423Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:9a0b8308063eac5ef8825c98ff3cd75d66c5ec282c002be8dd3d6a73337fbd10","observation_id":"e0c328e6-e129-4c3b-94e2-3bc18372faf5","resolution":{"observed_at":"2026-08-07T23:24:48.900423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.905419Z","title":"Qwen2.5-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.905419Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:7bd054f49253c6397c0fc43a8d0bff672d09b0e944aa8b05564c54be55fd888e","observation_id":"1c9e3033-ed5a-4ebb-b5c2-9c9bc343525b","resolution":{"observed_at":"2026-08-07T23:24:48.905419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.915306Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.915306Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:3e89229f56faca087f174c77adea476fa77a645de5d36c4db975071119aebcfc","observation_id":"e7aec70c-cff9-4657-95a8-14e5ec270626","resolution":{"observed_at":"2026-08-07T23:24:48.915306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.919954Z","title":"Align your latents: High-resolution video synthesis with latent diffusion models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.919954Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:5e13e9ebce1fb6b2c6c24ad0f32a44cdb4128b014550e71def985e3a415b4063","observation_id":"f4e01222-a462-47f1-8769-f251b1d97829","resolution":{"observed_at":"2026-08-07T23:24:48.919954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.924532Z","title":"Bruinsma, Ana Lucic, Megan Stanley, Anna Vaughan, Johannes Brandstetter, Patrick Garvan, Maik Riechert, Jonathan A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.924532Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:0d4367c0819539b4f7c512eb865864f86770acbcf96753fc1f0c1c4c6d4f17b4","observation_id":"08a77cb1-62c7-4212-be39-0d505c00db6c","resolution":{"observed_at":"2026-08-07T23:24:48.924532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.929922Z","title":"Bradley and Milton E","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.929922Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:f7d32ad493f3a606ef38e001065bc90902cb7232912fdfed5e3947e226cb4da6","observation_id":"2d1a6791-9ac9-4d11-a4a2-c6189f7f9025","resolution":{"observed_at":"2026-08-07T23:24:48.929922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.934742Z","title":"Efros, and Tero Karras","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.934742Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:a8a886966698b9090225e3576b621e0b589d5c59af1cb10b59e3472b486997fe","observation_id":"1dafd9e2-d524-463c-8765-c667503a3beb","resolution":{"observed_at":"2026-08-07T23:24:48.934742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.939667Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.939667Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:cc28a888f5488b8fde3f4c619d906d577f8a22d5164e977815dc83dc76142cff","observation_id":"8f99be9f-2c46-4c89-a8e8-634720a099f3","resolution":{"observed_at":"2026-08-07T23:24:48.939667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.944198Z","title":"Deep compression autoencoder for efficient high-resolution diffusion models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.944198Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:0d16ab7dbe6ffc90e82e3e01278aab2aa32b6b1ffe544326df8cb332578d35fa","observation_id":"ac82de2f-508f-42f8-94f2-b3442585c127","resolution":{"observed_at":"2026-08-07T23:24:48.944198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.948798Z","title":"Dc-videogen: Efficient video generation with deep compression video autoencoder, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.948798Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:1192d840181082439108b53ad9d246c9cb30487470eb27b039f37e38c5a5d09b","observation_id":"a01b3ac9-6c80-4101-a447-d258f2d05261","resolution":{"observed_at":"2026-08-07T23:24:48.948798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.953175Z","title":"Dc-ae 1.5: Accelerating diffusion model convergence with structured latent space, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.953175Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:8421ab349f6d8618357ca20435d88efb633ef01e0be3cbdc600b5f28a439860d","observation_id":"66f14d0a-fbab-440d-9a23-60e4be4f9113","resolution":{"observed_at":"2026-08-07T23:24:48.953175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15322","last_updated":"2025-04-07T18:00:00Z","snapshot_observed_at":"2026-08-03T17:32:04.376468Z","submitted_at":"2024-12-19T18:59:55Z","title":"MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15322","snapshot_observed_at":"2026-08-07T23:24:48.957682Z","title":"Taming multimodal joint training for high-quality video-to-audio synthesis.arXiv preprint arXiv:2412.15322, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.957682Z"},"links":{"cited_paper":"/paper/2412.15322","citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:95346f30b8d54214a77ef282385d02086cf973a5720d69ced80dba29bd32f0bb","observation_id":"8cfa0b25-621d-4ebf-a247-cdecb6287abc","resolution":{"observed_at":"2026-08-07T23:24:48.957682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.962483Z","title":"Chien, Liuzixuan Lin, Hai Nguyen, Varsha Rao, Tristan Sharma, and Rajini Wijayawardana","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.962483Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:56260ec394936f0c4bb09909b4cef9d8dd170ba188d89f729d21f15c50bfef58","observation_id":"39300b56-8bb8-49ca-a936-b46c8e8fdf26","resolution":{"observed_at":"2026-08-07T23:24:48.962483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.966861Z","title":"Chi, Jeff Dean, Jacob Devlin, Adam Roberts, Denny Zhou, Quoc V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.966861Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:8dc3b5efa7dfcc40f30a016a3301df9835835e14e446758913cace39d06337fd","observation_id":"3208e4f5-b9a4-4f4e-9113-e86893969d43","resolution":{"observed_at":"2026-08-07T23:24:48.966861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.971343Z","title":"Adversarial video generation on complex datasets, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.971343Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:00dadb2aa542a79d52459ab78e80e0f58cd92a84c3fee15437c9dcb0ff33a7dc","observation_id":"68383886-6f37-4b0b-8661-df2658afe5cf","resolution":{"observed_at":"2026-08-07T23:24:48.971343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-07T23:24:48.975675Z","title":"High fidelity neural audio compression.arXiv preprint arXiv:2210.13438, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.975675Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:11661e17d6b23b3af955e3c820dbd4ba35918784ab6bef098cac35d0c0933a2e","observation_id":"81dcc4f3-3506-4684-ad39-9ab84632b47e","resolution":{"observed_at":"2026-08-07T23:24:48.975675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.980726Z","title":"Irc-gan: Introspective recurrent convolutional gan for text-to-video generation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.980726Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:4196c0eaff1e60a8d2f7493dac075f2a2be4ed0fa601b759d5c78821d0efe2c5","observation_id":"79456876-3f1f-4d7b-b238-e098f9074619","resolution":{"observed_at":"2026-08-07T23:24:48.980726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.985253Z","title":"Taming transformers for high-resolution image synthesis, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.985253Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:1bb1b7a39bc2a2cf926e46b6be4dbee688ddbc8d66bf68f2ae3c258fd0ca160e","observation_id":"90a9e832-bdce-496d-afdd-d01c2ade3351","resolution":{"observed_at":"2026-08-07T23:24:48.985253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14358","last_updated":"2024-07-31T16:22:42Z","snapshot_observed_at":"2026-08-06T16:30:00.821754Z","submitted_at":"2024-07-19T14:40:23Z","title":"Stable Audio Open","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14358","snapshot_observed_at":"2026-08-07T23:24:48.989694Z","title":"Parker, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.989694Z"},"links":{"cited_paper":"/paper/2407.14358","citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:2ff7af3187f3f9b9a3abc0a23e98b0a4c2186115bbd3260a8ded0021fd2c39bf","observation_id":"4502afe0-0465-4f0f-9d01-890af4e52d42","resolution":{"observed_at":"2026-08-07T23:24:48.989694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.994502Z","title":"Parker, Matthew Rice, CJ Carr, Zack Zukowski, Josiah Taylor, and Jordi Pons","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.994502Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:1175abe2170b779ff34c802a2ebdda1f9630eaec02b86df2ff09aed26cf4b2c2","observation_id":"5b1c7234-92ae-487b-b756-b6f47c997c35","resolution":{"observed_at":"2026-08-07T23:24:48.994502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.998841Z","title":"The prism hypothesis: Harmonizing semantic and pixel representations via unified autoencoding, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.998841Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:9fb21a9c24802b738eabf21b95ebbd34b31bb45b7044eb78f25a19f157abbfe3","observation_id":"42f007fe-896c-4768-a598-b7200889aeab","resolution":{"observed_at":"2026-08-07T23:24:48.998841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.003333Z","title":"Gemmeke, Daniel P","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.003333Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:7b96e1fdf27c83010d8e702617b4ddf65705e9d0de054301c8769fc35ff2dddd","observation_id":"9afbd4dd-4573-449e-b4c3-10ea5566898c","resolution":{"observed_at":"2026-08-07T23:24:49.003333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.007973Z","title":"BigVGAN: A universal neural vocoder with large-scale training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.007973Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:17ec3c9d95377d020d87a2324b4c8a471a763c2c6dc06c9fb8ebb594b16fa5b9","observation_id":"6fe1651f-184c-4137-a0e1-f14a18e6255a","resolution":{"observed_at":"2026-08-07T23:24:49.007973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.012406Z","title":"Goodfellow, Jean Pouget-Abadie, Mehdi Mirza, Bing Xu, David Warde-Farley, Sherjil Ozair, Aaron Courville, and Yoshua Bengio","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.012406Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:bce8c1f6e17a982e7df65d97387897dabc2e284d1d406025da243f842d9d461b","observation_id":"cc499c7a-24e3-4967-9a5e-f6aaf1ad7721","resolution":{"observed_at":"2026-08-07T23:24:49.012406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.016907Z","title":"Veo 3.1: Our leading video generation model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.016907Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:ee856f204ac7a13f81ae3bcf8d20b7149926ba1901dbeba10e2de829bf73464c","observation_id":"aee2644b-0f0f-44a3-ac52-1f0c0a3d1f37","resolution":{"observed_at":"2026-08-07T23:24:49.016907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.021526Z","title":"Ltx-2: Efficient joint audio-visual foundation model, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.021526Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:de9400050dea670aa5657673529ee741bcaa26072c6aa360bcb2e81251efdef9","observation_id":"b3bd5b17-09ff-45ff-9cea-0b4fa494d047","resolution":{"observed_at":"2026-08-07T23:24:49.021526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.026296Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.026296Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:378636663ae36fdf4d0e757c647c2f8cab4bd6d87f3efea3e1938387d990b3ba","observation_id":"d25e578e-3c43-4d82-b3b6-a4d102f65412","resolution":{"observed_at":"2026-08-07T23:24:49.026296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.031152Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.031152Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:f0e2d15071b8ad5e8dd02c68744399bca631a509edb8c08b090dad7302594554","observation_id":"51815ec0-39d4-4233-b438-7d728e498fc2","resolution":{"observed_at":"2026-08-07T23:24:49.031152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.035612Z","title":"Kingma, Ben Poole, Mohammad Norouzi, David J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.035612Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:9727c0e76254caba8668b36e327220b32f48a43ec29b9f5f6a5ee451f82b7834","observation_id":"acfa54a4-7194-4056-9435-82f1d3aada79","resolution":{"observed_at":"2026-08-07T23:24:49.035612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.040278Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.040278Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:d632a9b038ed71c7172060d71960c0ade236aaae36bca5427e9ee337ebde4d2f","observation_id":"ac1880fa-d3b4-45ba-b19f-e5d33fbb0059","resolution":{"observed_at":"2026-08-07T23:24:49.040278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.045380Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.045380Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:9afad11de5ef206df4c4041a43d35b8aa48f0d6a333ebf3aca341ad4996b090a","observation_id":"74b0e03a-b622-43c5-9b45-0d0faf6572eb","resolution":{"observed_at":"2026-08-07T23:24:49.045380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.049876Z","title":"Tangoflux: Super fast and faithful text to audio generation with flow matching and clap-ranked preference optimization,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.049876Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:332356119622ce3772c53029c0f69c01228ac8f9cfa33e4d3bb35e64ac86a17d","observation_id":"388dabe9-9483-4020-a64f-bf40609068c2","resolution":{"observed_at":"2026-08-07T23:24:49.049876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.055309Z","title":"Perceptual evaluation of speech quality (PESQ).International Telecommunication Union, 2001","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.055309Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:325f1d9775ea65e4fc7a5f5fb8abc410e97fcaecb1a72ecd013936cad80fc338","observation_id":"62f3ccf0-45f6-46a3-bae0-92d1aad6f2da","resolution":{"observed_at":"2026-08-07T23:24:49.055309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.059886Z","title":"Video pixel networks, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.059886Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:cd3f062ffa0739b734f834d05c61b956935cd653e055fa88c2b3fc31ffdfc317","observation_id":"2f138c9e-758c-405e-b102-950da176a488","resolution":{"observed_at":"2026-08-07T23:24:49.059886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.064527Z","title":"Fréchet audio distance: A reference-free metric for evaluating music enhancement algorithms.Interspeech,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.064527Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:f28e774bab69d4a2ac9c30fe73a5084a14a0c71e9acd5eca2f7ba09fe5b9aec3","observation_id":"2b8624e0-78ca-499b-bff4-74489982f7a5","resolution":{"observed_at":"2026-08-07T23:24:49.064527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.069235Z","title":"AudioCaps: Generating captions for audios in the wild","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.069235Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:0f3435f6ffbec8d5b5285295d3e9eacc0204114ce2dd5875b85dd879f33e5655","observation_id":"232dab4f-1757-46a5-87c7-363c5b97a577","resolution":{"observed_at":"2026-08-07T23:24:49.069235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.073665Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.073665Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:01f79bc23132ac694b228d718ea8a39920a6e2a5a519f5febfcbf9fc051108da","observation_id":"9cddac63-115e-4f59-b7dc-a7ff81cc025e","resolution":{"observed_at":"2026-08-07T23:24:49.073665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.078139Z","title":"Auto-encoding variational bayes, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.078139Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:3de9c4d692875047944df4f4f0f0e4ddd9729dadd686624bc4d8581f146d0c9f","observation_id":"ac8ebf5b-0045-4547-8dd7-3bdecc1b4e8b","resolution":{"observed_at":"2026-08-07T23:24:49.078139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.082831Z","title":"Klingai enters the 3.0 era: All in one, one for all! kling 3.0 model now fully rolled out","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.082831Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:0ba2fc7f2052c4150788a5b98aad56bd60ac7f726094d93c874259da02dbae2c","observation_id":"eed9165a-132b-46a2-9a61-0628ff3086bd","resolution":{"observed_at":"2026-08-07T23:24:49.082831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.087019Z","title":"Carbon Emissions in the Tailpipe of Gen- erative AI.Harvard Data Science Review, 15(Special Issue 5), aug 20 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.087019Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:8213299ac282d0b7c222cd5bb2c7cdb4e9f4b208dd3a04ae4a265e82f5effd76","observation_id":"c3bfd2f4-fbfe-402a-bb65-80e0edfc4a3e","resolution":{"observed_at":"2026-08-07T23:24:49.087019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.091331Z","title":"Ross, Bryan Seybold, and Lu Jiang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.091331Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:9a9a8924e744adb479f715e9d062b249270df44141676c74c241a18907c8f2dd","observation_id":"5c12fc1a-6a0c-4df5-9492-f8bdbf88ce97","resolution":{"observed_at":"2026-08-07T23:24:49.091331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.095870Z","title":"HiFi-GAN: Generative adversarial networks for efficient and high fidelity speech synthesis","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.095870Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:c6fea87948853e990304ecdaa88311a193d8ff12d8b62fc4d8647e32b773f16e","observation_id":"11284e29-edbb-49d5-a292-19aed98a3d65","resolution":{"observed_at":"2026-08-07T23:24:49.095870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:51.098763Z","title":"Plumb- ley","venue":null,"work_id":"a18e0f80-46bb-448d-a066-81e7d25dbcdd","year":2020},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.100167Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:f73fbcb1ae016be689229d1d10b1eeaf1a6f1ef02ac7cd5ec07d5c5c6070ac8d","observation_id":"6df06d21-2e6f-4c84-9e10-0f5f86539d0c","resolution":{"observed_at":"2026-08-07T23:24:51.103658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.105028Z","title":"Hunyuanvideo: A systematic framework for large video generative models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.105028Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:ed696d06cd5d2be567fff5f1befc4b5cbf4e612f94ce6e8d0d75b68b5d38875e","observation_id":"0aaa8769-e8f5-470d-a322-8fcd01577bca","resolution":{"observed_at":"2026-08-07T23:24:49.105028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:51.072947Z","title":"Kandinsky video tools","venue":null,"work_id":"ac3ae5ef-731a-419c-b0b7-4350a0c25b0e","year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.109643Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:245aaf85c25c5a4d827e9f195cfe853e65b58b98b1da52b6f5205dde24cadb94","observation_id":"36e12cc6-4dc9-4036-9ac1-ee3691524038","resolution":{"observed_at":"2026-08-07T23:24:51.078140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:51.056506Z","title":"Efficient training of audio transformers with patchout","venue":null,"work_id":"5754c249-eb6a-45fc-8607-55a4c0669ea3","year":2022},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.114113Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:e1df759f2dbfbaa6bc1edc25f3f851497f27d0a95e82414fc360c4b1f60907a4","observation_id":"31a7a776-c7af-4f4f-8bc8-1312dd7dcb93","resolution":{"observed_at":"2026-08-07T23:24:51.062027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:51.041599Z","title":"Eq-vae: Equivariance regularized latent space for improved generative image modeling, 2025","venue":null,"work_id":"1d1d2fc8-5271-40e7-bd3e-813c116b8b06","year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.118762Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:07fc3aaf309479afd370f1d1db6d2a02427f7b30bd7d429cb49ee75cd54c7f00","observation_id":"127290f6-9b74-49d9-b344-b37a41322fd7","resolution":{"observed_at":"2026-08-07T23:24:51.046580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:51.025866Z","title":"High-fidelity audio compression with improved RVQGAN","venue":null,"work_id":"48d16d7a-e131-4f10-96a2-c832e10e57c5","year":2023},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.123265Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:2b600f3dca4b5e2d99a447311bf3865765a04955c1ccc590191ddc7e59a8a74f","observation_id":"998362ab-e4c9-4bf6-a90c-0ca4b683a950","resolution":{"observed_at":"2026-08-07T23:24:51.031097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:51.010114Z","title":"REPA-E: Unlocking vae for end-to-end tuning of latent diffusion transformers","venue":null,"work_id":"d2d9fdaf-4f21-48f7-a372-10b7b83bac28","year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.127893Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:bd7ddf6d31f30b90aa49508796e33388967811a62b6ee3a9546de8a5bab33fca","observation_id":"5848a0cc-c2f6-482d-954d-dfa79c488168","resolution":{"observed_at":"2026-08-07T23:24:51.015069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.24888","last_updated":"2026-06-23T17:59:55Z","snapshot_observed_at":"2026-08-08T16:38:03.178919Z","submitted_at":"2026-06-23T17:59:55Z","title":"DiffusionBench: On Holistic Evaluation of Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2606.24888","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.24888","snapshot_observed_at":"2026-08-07T23:24:50.091772Z","title":"DiffusionBench: On Holistic Evaluation of Diffusion Transformers","venue":"cs.CV","work_id":"b7598121-90ae-4e9e-9973-96d08b5e6961","year":2026},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.132533Z"},"links":{"cited_paper":"/paper/2606.24888","citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:1b3c40ac002a958c0fe5fef5bb85851720fb0f13d00fdd088367fbc7c96897c8","observation_id":"cc608454-847f-40a0-8459-3c9ccee14f2b","resolution":{"observed_at":"2026-08-07T23:24:50.096776Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.994559Z","title":"Wf-vae: Enhancing video vae by wavelet-driven energy flow for latent video diffusion model,","venue":null,"work_id":"e7501998-9e03-456c-a747-6e872601ba1a","year":null},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.137542Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:c8931222dab404d89e7a368e5d149ef7c47e37273776b090588758e4e3d948bd","observation_id":"83adf514-2156-4f71-a374-ffa46d3c452f","resolution":{"observed_at":"2026-08-07T23:24:50.999575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.979217Z","title":"Generating novel, designable, and diverse protein structures by equivariantly diffusing oriented residue clouds, 2023","venue":null,"work_id":"37ef3861-fafe-4d5e-b176-bd60fb8a0c96","year":2023},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.142269Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:27a1abd3ad0a10a3928ac3aca1d77dfd34679b77c74bde0f61c83d1ff2c02d4d","observation_id":"e5363bd6-7328-439c-add9-f9aedcb225ab","resolution":{"observed_at":"2026-08-07T23:24:50.984146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05734","last_updated":"2024-05-11T11:24:51Z","snapshot_observed_at":"2026-08-07T06:58:30.754944Z","submitted_at":"2023-08-10T17:55:13Z","title":"AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05734","snapshot_observed_at":"2026-08-07T23:24:49.146653Z","title":"Plumbley","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.146653Z"},"links":{"cited_paper":"/paper/2308.05734","citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:6789d2036049428a73a8587bdae2aeaca0d39ea1a1cc5581f84db1d118950306","observation_id":"267aeaba-7451-409e-b2f4-67858bde79ba","resolution":{"observed_at":"2026-08-07T23:24:49.146653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.05394","last_updated":"2026-07-24T07:04:43Z","snapshot_observed_at":"2026-08-03T18:25:53.262934Z","submitted_at":"2025-12-05T03:20:02Z","title":"Delving into Latent Spectral Biasing of Video VAEs for Superior Diffusability","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.05394","snapshot_observed_at":"2026-08-07T23:24:49.151448Z","title":"Delving into latent spectral biasing of video vaes for superior diffusability.arXiv preprint arXiv:2512.05394, 2025.https://arxiv.org/abs/2512.05394","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.151448Z"},"links":{"cited_paper":"/paper/2512.05394","citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:fafa552fa1819ec970a91442e5dc3dbd88fe123f8b5fd5dbb5283cecfb6c89f3","observation_id":"66ca06a4-e630-4e22-b35d-8cac8283534a","resolution":{"observed_at":"2026-08-07T23:24:49.151448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.964292Z","title":null,"venue":null,"work_id":"b15810a2-d0ca-4423-b6cb-3a0961b3a133","year":2022},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.156389Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:534250d9d713346556078bfae207c4a15c4d331497690e0bc4370ce848eba47e","observation_id":"acc391df-336e-415e-be70-460d0f658a11","resolution":{"observed_at":"2026-08-07T23:24:50.969040Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.949735Z","title":"The song describer dataset: A corpus of audio captions for music-and- language evaluation","venue":null,"work_id":"04747316-9c58-4648-82d0-7ace3cb0b0d9","year":2023},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.160855Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:e0ea887d910291cbf5131a6e3adbf02d00070fb2c1b8b4a3a388fc900074f9b9","observation_id":"b4353548-027b-4ca2-a114-f6b0f9e70e21","resolution":{"observed_at":"2026-08-07T23:24:50.954476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.934584Z","title":"Balasubramanian","venue":null,"work_id":"e07a2dfe-326d-4c04-8c10-5d3b7e8740db","year":2017},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.165459Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:e93ffc5257b51cb40b7a15016fc2725c22a9f3cf4951ad8621163a429ab85ed5","observation_id":"c0d76d52-e54f-48d8-a3be-b4b6bbb0005b","resolution":{"observed_at":"2026-08-07T23:24:50.939257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.920295Z","title":"Transition matching distillation for fast video generation, 2026","venue":null,"work_id":"9b0b1938-b39d-4816-a494-dd49602de6eb","year":2026},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.170003Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:c4ff7cad40b88bf0ebd9b3f5bbd64ff47bae7b66f087b7c4db9cf30a827948bf","observation_id":"b51194c7-d6ad-4f0a-8fe1-844428a199cb","resolution":{"observed_at":"2026-08-07T23:24:50.924914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.174272Z","title":"Blaschko, Albert Ali Salah, and Itir Onal Ertugrul","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.174272Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:780a71fdee7bb6ae45068df92890c11f1c5c1c7a465f74f7a727d688fc195f79","observation_id":"d1a2b48e-5f39-4930-9d4b-2590079c194c","resolution":{"observed_at":"2026-08-07T23:24:49.174272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.905157Z","title":"Alpamayo-r1: Bridging reasoning and action prediction for generalizable autonomous driving in the long tail, 2026","venue":null,"work_id":"7c030b10-0546-4dca-b024-6fc51a9d4c95","year":2026},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.178680Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:7ede3420b2bd673f25bcafa29f7f58d15fd187234eb1474ca5418b232a705251","observation_id":"81b25390-cc78-405e-975f-b87ef68d0aea","resolution":{"observed_at":"2026-08-07T23:24:50.910624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-07T23:24:49.183042Z","title":"Cosmos tokenizer: A suite of image and video neural tokenizers.arXiv preprint arXiv:2501.03575, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.183042Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:5ea86b1910491d75ddcf994daf94ea38bfdc7c4eea44286d3962ab005039b71e","observation_id":"6377f506-b873-48fb-9081-51f4cfa0c397","resolution":{"observed_at":"2026-08-07T23:24:49.183042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.890305Z","title":"To create what you tell: Generating videos from captions, 2018","venue":null,"work_id":"0a57e3c5-6295-447e-b6f7-9e6c277fe74f","year":2018},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.187278Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:6c394591486066631502c894d29e0935a608bff4e9302fdebd5345348d1f77de","observation_id":"800b8ce9-b089-4322-971e-87cb2867cc2f","resolution":{"observed_at":"2026-08-07T23:24:50.895129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.875363Z","title":"Librispeech: An ASR corpus based on public domain audio books","venue":null,"work_id":"47214ece-95ec-4c2c-b29b-941d3bfe704f","year":2015},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.192154Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:f1943fbb0cd2fd0ed53a702e947ba740b7289fce1e92cddd4185390f79b732b1","observation_id":"bbe6bb1f-7dfe-4235-8b32-0602637df5de","resolution":{"observed_at":"2026-08-07T23:24:50.880432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.859815Z","title":"Parker, Zach Evans, CJ Carr, Zack Zukowski, Josiah Taylor, Matthew Rice, and Jordi Pons","venue":null,"work_id":"ab9b947a-4bac-4a99-bde1-cf916c5ae6c0","year":2026},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.196758Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:85beb6a9bce515a3857e771ff839313418dfaf8d166de53ebc2dfee2235c8d92","observation_id":"be565eb9-cfe7-46b6-bb9b-8be96549aa1e","resolution":{"observed_at":"2026-08-07T23:24:50.864864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.843905Z","title":"Sampson, Shikai Li, Simone Parmeggiani, Steve Fine, Tara Fowler, Vladan Petrovic, and Yuming Du","venue":null,"work_id":"748c1391-18a3-4b00-a847-628543c9c0b4","year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.201249Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:57ffe063f849b105ac75ebac8a4996d663c23d026c9029dafc4407e12d933f60","observation_id":"8b31fb12-eda1-4f4a-bf0f-82d1d1e71768","resolution":{"observed_at":"2026-08-07T23:24:50.849477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.828501Z","title":"Andersson, Andrew El-Kadi, Dominic Masters, Timo Ewalds, Jacklynn Stott, Shakir Mohamed, Peter Battaglia, Remi Lam, and Matthew Willson","venue":null,"work_id":"2e9f33a3-03c2-4993-b23c-dcafec5058a6","year":2024},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.205992Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:90c074d5e68d93cd9e81930057f2cdbbb446982bba629067a2577b08474eaf10","observation_id":"ca168e10-08e7-4eab-87da-b326e642041e","resolution":{"observed_at":"2026-08-07T23:24:50.833535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.11738","last_updated":"2026-07-13T16:00:03Z","snapshot_observed_at":"2026-08-06T12:36:13.363835Z","submitted_at":"2026-07-13T16:00:03Z","title":"Qwen-Audio-VAE Technical Report","version":1},"cited_work":{"arxiv_id":"2607.11738","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.11738","snapshot_observed_at":"2026-08-07T23:24:49.818623Z","title":"Qwen-Audio-VAE Technical Report","venue":"eess.AS","work_id":"eaffe9c7-dd1f-4307-8cf5-8cda33cc4413","year":2026},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.210558Z"},"links":{"cited_paper":"/paper/2607.11738","citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:76a915a652b75e9330d26d2cbc47328be36e53d2155c1676006e698c1214699a","observation_id":"0ff90aab-604b-4284-bacd-ad48092a822b","resolution":{"observed_at":"2026-08-07T23:24:49.823936Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.13565","last_updated":"2026-05-13T14:04:56Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T14:04:56Z","title":"Qwen-Image-VAE-2.0 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.13565","snapshot_observed_at":"2026-08-07T23:24:49.215146Z","title":"Qwen-Image-V AE-2.0 technical report.arXiv preprint arXiv:2605.13565, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.215146Z"},"links":{"cited_paper":"/paper/2605.13565","citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:1c5ba31f28fb37b9123cfc0c45a0a75c1e3a5fbdfc4a1c92e5d38d774d088b01","observation_id":"396ca9dd-f10f-4d1b-9a33-54a7aca03ca7","resolution":{"observed_at":"2026-08-07T23:24:49.215146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.812547Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"5c663a1f-d7e4-4249-afdb-2dfb4fb6043e","year":2021},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.219882Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:a0d5f9eb08097c4cb5f0f024e643954dde756e75a6c1cee0b39d985dff8d80e8","observation_id":"a1a0de29-3159-47e1-bae3-88f9a00de7e8","resolution":{"observed_at":"2026-08-07T23:24:50.817684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.797494Z","title":"MUSDB18-HQ — an uncompressed version of MUSDB18, 2019","venue":null,"work_id":"72c68c90-cfd1-41a8-843b-4517c84aec59","year":2019},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.224296Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:f656ef7cca9d7a30113bc100c2f9a0a400734fc1cd436948d50b326e4af6f9f7","observation_id":"56dab5a3-9387-4627-a2a5-79b447587466","resolution":{"observed_at":"2026-08-07T23:24:50.802189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.782113Z","title":"EARS: An anechoic fullband speech dataset benchmarked for speech enhancement and dereverberation","venue":null,"work_id":"56263467-c70e-4634-8dfb-1820e748588d","year":2024},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.228947Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:9624d6672c24cebe0076af5781f1cbb49b5382e508c44a83e13c4d14b9a5b7e3","observation_id":"403980d2-0bb7-4e58-8a4e-b51a022855e0","resolution":{"observed_at":"2026-08-07T23:24:50.787304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.767713Z","title":"High-resolution image synthesis with latent diffusion models, 2022","venue":null,"work_id":"4532dd83-1815-431c-ad8a-73b6fc5fd959","year":2022},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.233612Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:7c50cc988b04cd338019930854e95a2050b25930101a64c04fdd641831f1eb31","observation_id":"908a6963-34df-4061-9ae6-a918534a033b","resolution":{"observed_at":"2026-08-07T23:24:50.772663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.752480Z","title":"High-resolution image synthesis with latent diffusion models, 2022","venue":null,"work_id":"c58b8bc7-7133-4313-85a0-81db5a07966d","year":2022},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.238165Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:b073234859cd9614e8167ce0e05de4906fef8d3722ce0a319556477f6722dcc7","observation_id":"df019351-9721-4388-8474-f420028c64c2","resolution":{"observed_at":"2026-08-07T23:24:50.757578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.737352Z","title":"Runway gen-4: Ai video generation with world consistency","venue":null,"work_id":"413a28a8-4ae4-4a4c-b232-ce89a5ba47ba","year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.242655Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:2d9e6c14dbeddeb662b50214c2cac0c70b9c4fad1e7f4e9db7dda56b13c2b633","observation_id":"d2ee0a73-a87d-4d66-8420-375818288256","resolution":{"observed_at":"2026-08-07T23:24:50.742254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.720801Z","title":"Flow to the mode: Mode-seeking diffusion autoencoders for state-of-the-art image tokenization, 2025","venue":null,"work_id":"73fe519a-0e0d-4796-8906-19b545477750","year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.246801Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:35654e484df98ecc50c9ce36a9c4395436c945808ceecca8374164971393cbe5","observation_id":"1381ca67-e28f-4a49-b640-88ed3f1cd99e","resolution":{"observed_at":"2026-08-07T23:24:50.725842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.705125Z","title":"Make- a-video: Text-to-video generation without text-video data, 2022","venue":null,"work_id":"822133ed-b162-4bc1-94b5-22fe7ac16bb9","year":2022},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.251220Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:9e0f0771bcba67abe83806bc3ac6ffb8c41fef0f09d284b9fab89eb243a2ee02","observation_id":"f28f6329-029f-4897-a6f0-4573d0b56e2d","resolution":{"observed_at":"2026-08-07T23:24:50.710306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.255842Z","title":"What matters for representation alignment: Global information or spatial structure?arXiv preprint arXiv:2512.10794, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.255842Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:b3c49b605a87dc16680e6fdff8d04cc54b73df437def99586c59355a287df8ff","observation_id":"a188e79e-5a70-4a33-b517-84db242a8fa8","resolution":{"observed_at":"2026-08-07T23:24:49.255842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.689133Z","title":"Improving the diffusability of autoencoders, 2025","venue":null,"work_id":"00d3b018-ff7f-4380-a2f4-c11e859aa071","year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.260320Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:d503f822fd68f2c7d84b92a19a932f84f65b5da47f1a4b4c61340084ef1e7b82","observation_id":"6cc40914-4d56-4056-b59a-1fdd5dd4ac21","resolution":{"observed_at":"2026-08-07T23:24:50.693904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.673748Z","title":"Stylegan-v: A continuous video generator with the price, image quality and perks of stylegan2, 2022","venue":null,"work_id":"007305c7-2192-4d26-939e-27e081519247","year":2022},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.264895Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:1ed108b0705e82a9525af8cc84b14c7843a05409e5f4f0e1670ca6e99e0215b0","observation_id":"76dfbbe9-c306-4d70-bad0-2e7965de56f9","resolution":{"observed_at":"2026-08-07T23:24:50.678729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.658086Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild, 2012","venue":null,"work_id":"6eff45d2-354b-4bd7-9615-a6fe6ccfa106","year":2012},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.269466Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:8ecffae0df816b1edb95444adbc1b8a5a3cf5e09f8089ca3c0f23b619f6f0d8a","observation_id":"8570bb5d-e8b1-4fe9-8313-b7bdf698ea11","resolution":{"observed_at":"2026-08-07T23:24:50.663478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.643160Z","title":"Scenediffuser++: City-scale traffic simulation via a generative world model, 2025","venue":null,"work_id":"67e93ecb-d16d-4f92-8678-e3d7faed7c61","year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.273993Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:585211c5997fa7d7643d7a20bc17487878fb72813bcfccd8d4e3659bacfdf4d9","observation_id":"19383de8-b3f2-4913-8671-bc2eb2dd16c3","resolution":{"observed_at":"2026-08-07T23:24:50.647889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.627903Z","title":"Z-image: An efficient image generation foundation model with single-stream diffusion transformer,","venue":null,"work_id":"3de892ba-b630-44a5-be76-292497e84f4c","year":null},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.278379Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:f98c086ccd5d345e83df348d5768c06386499d4570bbb9cadb2d1c9dea429068","observation_id":"95573368-f86d-4172-9e9e-868bfa40d269","resolution":{"observed_at":"2026-08-07T23:24:50.632963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.612890Z","title":null,"venue":null,"work_id":"ed7fbc8b-83bb-43a8-ad15-ac25ceee6f01","year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.282806Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:d715533592b44c0be27cf6251c621be046e8ce2a6ede6b41fbe0430195e67747","observation_id":"5405c1df-101f-4983-925d-d8fbf8ec6146","resolution":{"observed_at":"2026-08-07T23:24:50.617480Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.597978Z","title":"Nextstep-1: Toward autoregressive image generation with continuous tokens at scale, 2025","venue":null,"work_id":"56d87a36-4cd0-402e-9f34-2c99a979272a","year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.287263Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:8c3366e184c5c6bc24f17e5a3c5bf9ed38c430c2dd2e0b7fed770816ac22324c","observation_id":"49e126f2-5c89-408a-bd6a-c64e1f68d805","resolution":{"observed_at":"2026-08-07T23:24:50.602974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.16930","last_updated":"2025-08-23T07:30:18Z","snapshot_observed_at":"2026-08-07T20:59:21.703704Z","submitted_at":"2025-08-23T07:30:18Z","title":"HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.16930","snapshot_observed_at":"2026-08-07T23:24:49.291826Z","title":"HunyuanVideo-Foley: Multimodal diffusion with representation alignment for high-fidelity foley audio generation.arXiv preprint arXiv:2508.16930, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.291826Z"},"links":{"cited_paper":"/paper/2508.16930","citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:90cb880a84bc92af4496efafe3278599bb3a4f806b3b678af8560d28aaa12d25","observation_id":"54f8ed22-adc4-477d-aa77-894691e0c336","resolution":{"observed_at":"2026-08-07T23:24:49.291826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.583142Z","title":"Reducio! generating 1k video within 16 seconds using extremely compressed motion latents, 2025","venue":null,"work_id":"95d84b43-809c-47ed-8f94-10a5990f71b0","year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.296716Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:b2e75c18299c35fd01a51f519d4d5696f9c70fc5ecc1b436f00ca38782fc6d90","observation_id":"fa0cbf27-e6fc-431d-af41-a2baebeba92c","resolution":{"observed_at":"2026-08-07T23:24:50.587939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.568506Z","title":"Metaxas, and Sergey Tulyakov","venue":null,"work_id":"35f00957-a501-46c6-8431-b281628bd616","year":2021},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.301476Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:ee4236ea97a2496a67ad321b6c4b88535d8cbfefc897f8b575f9c834ef3e5f85","observation_id":"efee10b7-6d58-44ed-b07b-e9ab1e95acaf","resolution":{"observed_at":"2026-08-07T23:24:50.573136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05139","last_updated":"2025-02-07T18:15:57Z","snapshot_observed_at":"2026-07-06T20:33:01.960703Z","submitted_at":"2025-02-07T18:15:57Z","title":"Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05139","snapshot_observed_at":"2026-08-07T23:24:49.306053Z","title":"Meta audiobox aesthetics: Unified automatic quality assessment for speech, music, and sound","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.306053Z"},"links":{"cited_paper":"/paper/2502.05139","citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:1bc60c277b010e5d4170803bef4789071c1bd980f6a20535ed856075efbcacd4","observation_id":"23c4e403-bc4d-43c7-8fee-7ada83688ad1","resolution":{"observed_at":"2026-08-07T23:24:49.306053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.553952Z","title":"Ssdd: Single-step diffusion decoder for efficient image tokenization, 2026","venue":null,"work_id":"13052c53-b090-435a-b9c2-64392db8a66b","year":2026},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.310789Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:4e813472c4cfe2d8c5b4e9375f10f431f97c934e3d9a5b11e8b53e3368a4559d","observation_id":"efeb5b68-bd37-45d3-a383-dc5adebe7538","resolution":{"observed_at":"2026-08-07T23:24:50.558721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.539325Z","title":"Conditional image generation with pixelcnn decoders, 2016","venue":null,"work_id":"bcc3b82c-a48b-482f-8f4d-d23b60b3a3fb","year":2016},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.315228Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:852b77bb5f55f5cc193ac2d89fed57e63a789fee8257635aaef957dc3427d6f0","observation_id":"f8046108-5b8b-4da1-b9d0-9f8cde99f1d4","resolution":{"observed_at":"2026-08-07T23:24:50.544106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.524812Z","title":"Neural discrete representation learning, 2018","venue":null,"work_id":"7fb3e2eb-21f9-450d-9258-c98d5eef6db5","year":2018},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.319830Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:cc07387e6b9631e940f7a9347c07547ce3a5e851969cf82a3f1b888ccecd6bc5","observation_id":"235a4e58-ae68-4a14-8a35-8677b551f010","resolution":{"observed_at":"2026-08-07T23:24:50.529444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.510185Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"9e1569cf-f5e6-44c0-8081-9ff4b787e239","year":2023},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.324257Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:583efe738714be21ecf7e17643b6a27690eed37cf9a4b61b6bce6b1bb05b177e","observation_id":"fcb04103-a5e0-40db-82c6-a454a4cc5187","resolution":{"observed_at":"2026-08-07T23:24:50.514926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.494721Z","title":"Generating videos with scene dynamics, 2016","venue":null,"work_id":"6115c9b0-94ec-49c0-baa1-579f92b2f118","year":2016},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.328663Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:7196cc24d4a21fedb8d8be023b4a005e187348ad276ab5a72ec3635cf44766be","observation_id":"2283e7e1-6c9b-45bc-a3ee-a12990febe3d","resolution":{"observed_at":"2026-08-07T23:24:50.499693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.480274Z","title":"Wan: Open and advanced large-scale video generative models, 2025","venue":null,"work_id":"2d755a35-a8cc-4076-8252-392dc58f28ee","year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.333015Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:d4c3233a280d100976608a2372810da1ce54dca244bb42516ac2594493879740","observation_id":"3d01af25-d7ad-4d26-9e55-82118e8e8c08","resolution":{"observed_at":"2026-08-07T23:24:50.484897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.466139Z","title":"Wan-2.2 anouncement","venue":null,"work_id":"4891d4f4-1023-4828-82aa-2f6931b5108a","year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.337918Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:acfb4d0e7b9a1a8c6f8cecbf46bc0a626d3d6610574c9b2ad43819d32419628a","observation_id":"69657ab6-1c35-43ea-8ef2-6a4476db2986","resolution":{"observed_at":"2026-08-07T23:24:50.470707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.451861Z","title":null,"venue":null,"work_id":"44a6abc7-f84b-413a-8ec6-9368ccf62d4c","year":2016},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.342282Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:29c8e54945681730eb3ae8c3b70e2caa329ed22768e4e947c91c84430fc8099b","observation_id":"76571650-0562-4483-9884-118e27a89523","resolution":{"observed_at":"2026-08-07T23:24:50.456314Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.437615Z","title":"Videomae v2: Scaling video masked autoencoders with dual masking","venue":null,"work_id":"02329911-68f2-428a-8f73-956ab17c6976","year":null},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.346598Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:cce47b4c8940701a3616d40ae39e3a5b6eedce468569735dea533da1505fac8a","observation_id":"56c741e4-ba26-43b8-a506-dd18820a4bb4","resolution":{"observed_at":"2026-08-07T23:24:50.442381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T17:18:59.386835Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":57,"verified_exact":2,"verified_fuzzy":41},"total_outbound_references":122},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 100 of 122 outbound references and 0 inbound Pith citation observations for arXiv:2608.05798."}