Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-03T01:51:01.976970Z
Paper Citation Record · LEDGER
As of 4 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2607.23855.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-03T01:51:01.976970Z
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-04T06:34:03.388597+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links
A source-named dated measurement, never combined with another source.
Source: cited_works
54 of 54 outbound references displayed
External citation measurements
No source-named external measurement is stored.
Observation e782bb66-d958-4d08-a0de-535576c1bae4 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Auto-Encoding Variational Bayes
Reference 1
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f1e7537f-ad84-4ebd-ba0f-abe4e25c184d · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Reconstruction vs. Generation: Taming Optimization Dilemma in Latent Diffusion Models
Reference 2
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e3a61767-901c-4fab-a645-7f9a4cca5204 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Diffusion Transformers with Representation Autoencoders
Reference 3
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 184be546-ffba-4adf-86ec-b83c1e6b6403 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
Reference 4
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7a5a578d-8314-48f2-bb12-9320ee25e173 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation MOSS-Audio-Tokenizer: Scaling audio tokenizers for future audio foundation models, 2026
Reference 5
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b56f5550-89ea-42d0-86ea-fcdc90528827 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation MMAudio: Taming multimodal joint training for high-quality video-to-audio synthesis
Reference 6
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation cd819ac4-c5f8-4256-a072-c63afde3c7ac · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation
Reference 7
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation faf7098c-f117-4ad2-9625-efb1f819750f · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Synchformer: Efficientsynchronizationfromsparse cues
Reference 8
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 20bcff55-fcfd-4787-b494-5d7ceb524813 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Representation Learning with Contrastive Predictive Coding
Reference 9
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8504279f-e18e-4704-a13f-cb813b8e5905 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Qwen3-Omni Technical Report
Reference 10
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e7ac17c1-a950-4760-90fc-950c95dead22 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Learning Transferable Visual Models From Natural Language Supervision
Reference 11
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 83822ea9-a08a-4d7b-b085-7fa3729229f7 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation ImageBind: One Embedding Space To Bind Them All
Reference 12
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d29f2f3e-8aef-4907-9929-12debd347a58 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation LanguageBind: Extending video-language pretraining to n-modality by language-based semantic alignment
Reference 13
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3b704d31-f3ba-4ae5-8cbe-814ae169467a · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Liu, SouYoung Jin, Cheng-I Lai, Andrew Rouditchenko, Aude Oliva, and James Glass
Reference 14
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4ebfe323-4658-46e5-b1e2-e9c93b42f741 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment
Reference 15
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 6b474239-886f-4980-a8fe-b3b86fb3092f · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Enhancing multimodal unified representations for cross modal generalization
Reference 16
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 89510f85-4493-46d8-8234-162221f21ee9 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Achieving cross modal generalization with multimodal unified representation
Reference 17
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8ff6db8f-ccb6-4ee2-9e5e-5aab3c13a336 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Wan: Open and Advanced Large-Scale Video Generative Models
Reference 18
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a9270da1-f028-4722-8008-f5395ea7f785 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Out of time: Automated lip sync in the wild
Reference 19
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b693b372-f65d-4222-9903-f5161639ba97 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation High-Fidelity Audio Compression with Improved RVQGAN
Reference 20
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 2064a707-8cb0-484b-9b56-6f8a5534a63f · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Movie Gen: A Cast of Media Foundation Models
Reference 21
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4b26fcb7-0187-4926-859f-28296984aec5 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Qwen-Audio-VAE Technical Report
Reference 22
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 78d88f69-da67-4d9b-8c79-b72340a512e1 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Fast Timing-Conditioned Latent Audio Diffusion
Reference 23
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 26a46fe7-08e5-46da-85b9-7bb7048e11c0 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation UniTok: A unified tokenizer for visual generation and understanding
Reference 24
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b20d0e2d-08d8-46e7-a443-ecfffa5a2f23 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation REPA-E: Unlocking VAEforend-to-endtuningwithlatentdiffusiontransformers
Reference 25
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 48b9be9c-e0bc-4d85-ae61-c108aca71a42 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation MM-Diffusion: Learning multi-modal diffusion models for joint audio and video generation
Reference 26
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 74a75c4e-7aac-4022-bbb6-70c029d71a07 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Towards scalable pre-training of visual tokenizers for generation, 2025
Reference 27
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8bb63cca-50b1-4840-8161-b25366335da4 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Sora 2 system card.https://openai.com/index/sora-2-system-card/, 2025
Reference 28
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 61d446cc-1419-4cc7-9154-3d12603f7e74 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation AV-DiT: Efficient Audio-Visual Diffusion Transformer for Joint Audio and Video Generation
Reference 29
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e996ac06-3573-4d32-b2b9-0bf410c64498 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Seedance 2.0: Advancing Video Generation for World Complexity
Reference 30
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e3612b57-5072-443f-8836-3efa3022208d · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Veo 3.https://deepmind.google/models/veo/, 2025
Reference 31
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 38d2269b-b1ec-4fac-a98f-f90a832b2a85 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation
Reference 32
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 418cd17a-d556-40e1-8eae-683d909792ad · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation JavisDiT: Joint audio-video diffusion transformer with hierarchical spatio-temporal prior synchro- nization, 2025
Reference 33
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation caa853c6-7d08-49ee-a873-848a57706c12 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation MOVA: Towards scalable and synchronized video-audio generation, 2026
Reference 34
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1acf9e11-fef4-4762-864b-c2ba78f7c000 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation LTX-2: Efficient joint audio-visual foundation model, 2026
Reference 35
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8a89e8ce-6141-4927-ab1e-00ef378e3e35 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Rep- resentation alignment for generation: Training diffusion transformers is easier than you think
Reference 36
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 25f649a4-0a53-4691-8c6d-e7ed0adf4c2b · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Wan2.2-T2V-A14B model card
Reference 37
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d1900e63-3023-4997-8c15-883fd06e9243 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Efros, Eli Shechtman, and Oliver Wang
Reference 38
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ca114542-a971-4ab7-9cda-9b701c9b95d1 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation What matters for representation alignment: Global information or spatial structure?, 2025
Reference 39
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c1be5cbd-a4f5-4885-a934-f673833d93e6 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Gemmeke, Daniel P
Reference 40
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3cdad4a4-601b-452a-afb4-4458397ec441 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation BEATs: Audio Pre-Training with Acoustic Tokenizers
Reference 41
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8ce5ffb6-5ac8-47f8-80a3-e747aa20f0e6 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild
Reference 42
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 49a66139-33f0-48e3-be67-1d7851216126 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Qwen3.5: Towards native multimodal agents, 2026
Reference 43
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation fae64e3d-4093-4708-bc11-4c0930228803 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation LibriSpeech: An ASR corpus based on public domain audio books
Reference 44
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f8fdcd0a-d5ec-4d00-bd86-7db18e700773 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Panda-70M: Captioning 70m videos with multiple cross-modality teachers
Reference 45
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 40bc4501-15fe-44f1-ad95-1c5d689f1cb4 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Parker, Matthew Rice, CJ Carr, Zack Zukowski, Josiah Taylor, and Jordi Pons
Reference 46
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c461c2d0-a264-46cc-9259-24ad685b063e · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation The MUSDB18 corpus for music separation
Reference 47
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 21161479-4a3c-482d-ba48-e507aec59e1c · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Sparse in Space and Time: Audio-visual Synchronisation with Trainable Selectors
Reference 48
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation bf7e1cdb-655d-47ae-bc6f-20dc5ede3e92 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound
Reference 49
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ca8cbbe6-f844-4c67-b15f-830ea4881695 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation VGGSound: A large-scaleaudio-visual dataset
Reference 50
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 43146570-5131-4033-93ae-b3197ea0369b · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Multi-task learning using uncertainty to weigh losses for scene geometry and semantics
Reference 51
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 118dfa17-bd41-4389-ab74-5aae05eaebde · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation UniVerse-1: Unified Audio-Video Generation via Stitching of Experts
Reference 53
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7dee2a1a-47b2-437d-bb24-c1d1b052b0d3 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Unresolved cited work
Reference 2024
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8a027708-046b-4f67-8d43-77234f34fa63 · outbound
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Stable Audio 3
Reference 2026
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
No inbound Pith citation observations are available.