{"as_of":"2026-08-05T08:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3cf9ad556da1b5dafb78985917ef6f525d9c50dddc3756da4e99315a62365c67","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T01:51:01.976970Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.23855/citation-record","integrity":"/paper/2607.23855/integrity","json":"/paper/2607.23855/citation-record.json","paper":"/paper/2607.23855"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-03T01:50:56.838514Z","title":"Kingma and Max Welling","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T01:50:56.838514Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:77ce4fdb607b6077c8108d40e5e77b4c9a317ba9fd8b02deeb16818bff112803","observation_id":"e782bb66-d958-4d08-a0de-535576c1bae4","resolution":{"observed_at":"2026-08-03T01:50:56.838514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01423","last_updated":"2025-03-10T11:43:42Z","snapshot_observed_at":"2026-07-06T20:15:54.645357Z","submitted_at":"2025-01-02T18:59:40Z","title":"Reconstruction vs. Generation: Taming Optimization Dilemma in Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01423","snapshot_observed_at":"2026-08-03T01:50:56.920896Z","title":"Reconstructionvs.generation: Tamingoptimizationdilemmainlatent diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T01:50:56.920896Z"},"links":{"cited_paper":"/paper/2501.01423","citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:849d02783ff6032537e11a2bce2d648fbc57adcac6e692e977dde5433430dd1c","observation_id":"f1e7537f-ad84-4ebd-ba0f-abe4e25c184d","resolution":{"observed_at":"2026-08-03T01:50:56.920896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.11690","last_updated":"2025-10-13T17:51:39Z","snapshot_observed_at":"2026-07-06T22:32:32.632779Z","submitted_at":"2025-10-13T17:51:39Z","title":"Diffusion Transformers with Representation Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.11690","snapshot_observed_at":"2026-08-03T01:50:57.072895Z","title":"Diffusion transformers with representation autoen- coders, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T01:50:57.072895Z"},"links":{"cited_paper":"/paper/2510.11690","citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:a7e48e66c6593e6d854752528055f201013427638c4383df9d519b1289d12068","observation_id":"e3a61767-901c-4fab-a645-7f9a4cca5204","resolution":{"observed_at":"2026-08-03T01:50:57.072895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-03T01:50:57.207168Z","title":"SpeechTokenizer: Unified speech tokenizer for speech large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T01:50:57.207168Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:b3adabf59d6574beff544f20b087b25c999b4cd5a48e3770fb6a7e3fc4f178b4","observation_id":"184be546-ffba-4adf-86ec-b83c1e6b6403","resolution":{"observed_at":"2026-08-03T01:50:57.207168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:50:57.372899Z","title":"MOSS-Audio-Tokenizer: Scaling audio tokenizers for future audio foundation models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T01:50:57.372899Z"},"links":{"citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:bdd97288e84da844fd05c1afb180d4cfc9655e04ed5c70683665ce2171a39135","observation_id":"7a5a578d-8314-48f2-bb12-9320ee25e173","resolution":{"observed_at":"2026-08-03T01:50:57.372899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:50:57.498868Z","title":"MMAudio: Taming multimodal joint training for high-quality video-to-audio synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T01:50:57.498868Z"},"links":{"citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:b8ae9051b56032684563136f728e93d7a0f9806b755075b67c0f33d29edc2740","observation_id":"b56f5550-89ea-42d0-86ea-fcdc90528827","resolution":{"observed_at":"2026-08-03T01:50:57.498868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.16930","last_updated":"2025-08-23T07:30:18Z","snapshot_observed_at":"2026-07-06T22:17:02.502437Z","submitted_at":"2025-08-23T07:30:18Z","title":"HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.16930","snapshot_observed_at":"2026-08-03T01:50:57.596815Z","title":"Hunyuanvideo- foley: Multimodal diffusion with representation alignment for high-fidelity foley audio generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T01:50:57.596815Z"},"links":{"cited_paper":"/paper/2508.16930","citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:a3aae1d17dff6884c3a53fb0915a676826650f22abb1b1dcb37b0081cacc776a","observation_id":"cd819ac4-c5f8-4256-a072-c63afde3c7ac","resolution":{"observed_at":"2026-08-03T01:50:57.596815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:50:57.708665Z","title":"Synchformer: Efficientsynchronizationfromsparse cues","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T01:50:57.708665Z"},"links":{"citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:1cca55d32f27da359461473e58548edc897033f1a6193c6c2b83c6abec21d59e","observation_id":"faf7098c-f117-4ad2-9625-efb1f819750f","resolution":{"observed_at":"2026-08-03T01:50:57.708665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-03T01:50:57.909221Z","title":"Representationlearningwithcontrastivepredictivecoding, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T01:50:57.909221Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:c86ac5dcd50f39eaeaac93ce9cd3c390e5870631c93b20a39c624d89e0643fc8","observation_id":"20bcff55-fcfd-4787-b494-5d7ceb524813","resolution":{"observed_at":"2026-08-03T01:50:57.909221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-03T01:50:57.917314Z","title":"Qwen3- Omni technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T01:50:57.917314Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:47fd29fa5f0730af84868a593c1ec885f68a459115b67d3b4479f1d58eaf84c7","observation_id":"8504279f-e18e-4704-a13f-cb813b8e5905","resolution":{"observed_at":"2026-08-03T01:50:57.917314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-03T01:50:57.934235Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T01:50:57.934235Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:790123d1636e95527e5f7b1bfdc0f0f0361e80beece17e269126c22cbaa5d5a9","observation_id":"e7ac17c1-a950-4760-90fc-950c95dead22","resolution":{"observed_at":"2026-08-03T01:50:57.934235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05665","last_updated":"2023-05-31T04:57:12Z","snapshot_observed_at":"2026-07-06T15:25:12.782361Z","submitted_at":"2023-05-09T17:59:07Z","title":"ImageBind: One Embedding Space To Bind Them All","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05665","snapshot_observed_at":"2026-08-03T01:50:57.995004Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T01:50:57.995004Z"},"links":{"cited_paper":"/paper/2305.05665","citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:79cc733bafc0ceaf45dcd689c2ed2542162a07fd58f54aebefce0011ba136ba7","observation_id":"83822ea9-a08a-4d7b-b085-7fa3729229f7","resolution":{"observed_at":"2026-08-03T01:50:57.995004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:50:58.086704Z","title":"LanguageBind: Extending video-language pretraining to n-modality by language-based semantic alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T01:50:58.086704Z"},"links":{"citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:8ae635cf163c878bf896142bdf8637c560b1bad94ea58fcf949577662569a933","observation_id":"d29f2f3e-8aef-4907-9929-12debd347a58","resolution":{"observed_at":"2026-08-03T01:50:58.086704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:50:58.338091Z","title":"Liu, SouYoung Jin, Cheng-I Lai, Andrew Rouditchenko, Aude Oliva, and James Glass","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T01:50:58.338091Z"},"links":{"citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:618ed368852fda21a82593efb6195e9878c0392254a22cce51b27ea3c9746fd8","observation_id":"3b704d31-f3ba-4ae5-8cbe-814ae169467a","resolution":{"observed_at":"2026-08-03T01:50:58.338091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01852","last_updated":"2024-01-22T03:11:15Z","snapshot_observed_at":"2026-08-02T22:12:20.187464Z","submitted_at":"2023-10-03T07:33:27Z","title":"LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01852","snapshot_observed_at":"2026-08-03T01:50:58.195894Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T01:50:58.195894Z"},"links":{"cited_paper":"/paper/2310.01852","citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:0573c1130d30f73255b8c508eb49c0a8c71e08669710f29576b8f21101b25a69","observation_id":"4ebfe323-4658-46e5-b1e2-e9c93b42f741","resolution":{"observed_at":"2026-08-03T01:50:58.195894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:50:58.554333Z","title":"Enhancing multimodal unified representations for cross modal generalization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T01:50:58.554333Z"},"links":{"citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:89cd21907f07bebaa0f88e4eff0d96216f4e9ca7278073cb19960c36517974a0","observation_id":"6b474239-886f-4980-a8fe-b3b86fb3092f","resolution":{"observed_at":"2026-08-03T01:50:58.554333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:50:58.446914Z","title":"Achieving cross modal generalization with multimodal unified representation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T01:50:58.446914Z"},"links":{"citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:b9f4511c566117bbdb09506c336aaf8b7a48841a9a0301e27c83182e81a2155d","observation_id":"89510f85-4493-46d8-8234-162221f21ee9","resolution":{"observed_at":"2026-08-03T01:50:58.446914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-03T01:50:58.816957Z","title":"Wan: Open and advanced large-scale video generative models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T01:50:58.816957Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:734643a44eeb7fbff5c13269a5688607fa66376d4a072dffcac791f9eff15a6f","observation_id":"8ff6db8f-ccb6-4ee2-9e5e-5aab3c13a336","resolution":{"observed_at":"2026-08-03T01:50:58.816957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:50:58.703150Z","title":"Out of time: Automated lip sync in the wild","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T01:50:58.703150Z"},"links":{"citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:a2cf699d988623f7f0a9943d7fc3f817270cc648d870ac2cb0d4293d246157a1","observation_id":"a9270da1-f028-4722-8008-f5395ea7f785","resolution":{"observed_at":"2026-08-03T01:50:58.703150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.06546","last_updated":"2023-10-26T22:17:49Z","snapshot_observed_at":"2026-07-06T15:41:13.274608Z","submitted_at":"2023-06-11T00:13:00Z","title":"High-Fidelity Audio Compression with Improved RVQGAN","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.06546","snapshot_observed_at":"2026-08-03T01:50:59.050808Z","title":"High-fidelity audio compression with improved RVQGAN","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T01:50:59.050808Z"},"links":{"cited_paper":"/paper/2306.06546","citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:ca31c0c3e1a575b31d2e2da4c230aecf267084fcb6676dab95c4f10476e7d267","observation_id":"b693b372-f65d-4222-9903-f5161639ba97","resolution":{"observed_at":"2026-08-03T01:50:59.050808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-03T01:50:58.947738Z","title":"Movie gen: A cast of media foundation models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T01:50:58.947738Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:653f0e97eb311f30aafc59d660ee0c2bd08262adf92391ddfff0ff1c3ae38484","observation_id":"2064a707-8cb0-484b-9b56-6f8a5534a63f","resolution":{"observed_at":"2026-08-03T01:50:58.947738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.11738","last_updated":"2026-07-13T16:00:03Z","snapshot_observed_at":"2026-08-02T08:52:21.513313Z","submitted_at":"2026-07-13T16:00:03Z","title":"Qwen-Audio-VAE Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.11738","snapshot_observed_at":"2026-08-03T01:50:59.197280Z","title":"Qwen-audio-vae technical report.arXiv preprint arXiv:2607.11738, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T01:50:59.197280Z"},"links":{"cited_paper":"/paper/2607.11738","citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:1c79e867f0ea44329e490a324987a5e1690e6d82a5dd2b3ab1a450bf7dc331a8","observation_id":"4b26fcb7-0187-4926-859f-28296984aec5","resolution":{"observed_at":"2026-08-03T01:50:59.197280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04825","last_updated":"2024-05-13T14:05:00Z","snapshot_observed_at":"2026-07-06T17:26:47.184846Z","submitted_at":"2024-02-07T13:23:25Z","title":"Fast Timing-Conditioned Latent Audio Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04825","snapshot_observed_at":"2026-08-03T01:50:59.120923Z","title":"Hawley, and Jordi Pons","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T01:50:59.120923Z"},"links":{"cited_paper":"/paper/2402.04825","citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:79eaae240da156fb699bfb8bd7c77f95577163b4fef458b3b47cffdb72d3b679","observation_id":"78d88f69-da67-4d9b-8c79-b72340a512e1","resolution":{"observed_at":"2026-08-03T01:50:59.120923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:50:59.330818Z","title":"UniTok: A unified tokenizer for visual generation and understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T01:50:59.330818Z"},"links":{"citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:b00beeda391fad93e5545c5e6034e3931a3ddb71b221b2a11e32f849666dca99","observation_id":"26a46fe7-08e5-46da-85b9-7bb7048e11c0","resolution":{"observed_at":"2026-08-03T01:50:59.330818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:50:59.256143Z","title":"REPA-E: Unlocking VAEforend-to-endtuningwithlatentdiffusiontransformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T01:50:59.256143Z"},"links":{"citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:9d6b6931797f489e67d18199b728635d651e11026f35d0c038d635a8f2853be8","observation_id":"b20d0e2d-08d8-46e7-a443-ecfffa5a2f23","resolution":{"observed_at":"2026-08-03T01:50:59.256143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:50:59.481977Z","title":"MM-Diffusion: Learning multi-modal diffusion models for joint audio and video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T01:50:59.481977Z"},"links":{"citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:c83f612974a054c56a2f6b3c669e7c114e303759a704d82ac160aa9660574274","observation_id":"48b9be9c-e0bc-4d85-ae61-c108aca71a42","resolution":{"observed_at":"2026-08-03T01:50:59.481977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:50:59.413155Z","title":"Towards scalable pre-training of visual tokenizers for generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T01:50:59.413155Z"},"links":{"citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:1f3622c955c0d76396c32a4fa1fa9ead9dce2fff3fba6dd45db3c58d95075d66","observation_id":"74a75c4e-7aac-4022-bbb6-70c029d71a07","resolution":{"observed_at":"2026-08-03T01:50:59.413155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:50:59.644940Z","title":"Sora 2 system card.https://openai.com/index/sora-2-system-card/, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T01:50:59.644940Z"},"links":{"citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:27999b6bc2b95b59715c1d991553e4b3078b497884c7b8ac526048ddf359ffd5","observation_id":"8bb63cca-50b1-4840-8161-b25366335da4","resolution":{"observed_at":"2026-08-03T01:50:59.644940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07686","last_updated":"2024-06-11T20:05:58Z","snapshot_observed_at":"2026-07-06T18:29:12.931702Z","submitted_at":"2024-06-11T20:05:58Z","title":"AV-DiT: Efficient Audio-Visual Diffusion Transformer for Joint Audio and Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07686","snapshot_observed_at":"2026-08-03T01:50:59.576752Z","title":"AV-DiT: Efficient audio-visual diffusion transformer for joint audio and video generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T01:50:59.576752Z"},"links":{"cited_paper":"/paper/2406.07686","citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:f9242aadfa6e80259cc890add2925c3a4e69995512a25ce65610060bcabe38af","observation_id":"61d446cc-1419-4cc7-9154-3d12603f7e74","resolution":{"observed_at":"2026-08-03T01:50:59.576752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14148","last_updated":"2026-04-15T17:59:40Z","snapshot_observed_at":"2026-07-06T23:02:00.082783Z","submitted_at":"2026-04-15T17:59:40Z","title":"Seedance 2.0: Advancing Video Generation for World Complexity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.14148","snapshot_observed_at":"2026-08-03T01:50:59.779959Z","title":"Seedance 2.0: Advancing video generation for world complexity, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T01:50:59.779959Z"},"links":{"cited_paper":"/paper/2604.14148","citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:f90228035657a7f0faf297012573f52ac749420cd764e4eda62502466355e4b5","observation_id":"e996ac06-3573-4d32-b2b9-0bf410c64498","resolution":{"observed_at":"2026-08-03T01:50:59.779959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:50:59.705460Z","title":"Veo 3.https://deepmind.google/models/veo/, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T01:50:59.705460Z"},"links":{"citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:809ce3fd09112ef771fee18528078eea7f981194a9ae77484ac223f7b014b7b9","observation_id":"e3612b57-5072-443f-8836-3efa3022208d","resolution":{"observed_at":"2026-08-03T01:50:59.705460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.01284","last_updated":"2025-09-30T21:03:50Z","snapshot_observed_at":"2026-08-04T22:22:45.362136Z","submitted_at":"2025-09-30T21:03:50Z","title":"Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.01284","snapshot_observed_at":"2026-08-03T01:50:59.933544Z","title":"Ovi: Twin backbone cross-modal fusion for audio-video genera- tion, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T01:50:59.933544Z"},"links":{"cited_paper":"/paper/2510.01284","citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:633a5acead89917faa3fc18cfcc41779e23bb8aa61ff7ce542d10e1110f027dd","observation_id":"38d2269b-b1ec-4fac-a98f-f90a832b2a85","resolution":{"observed_at":"2026-08-03T01:50:59.933544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:50:59.876252Z","title":"JavisDiT: Joint audio-video diffusion transformer with hierarchical spatio-temporal prior synchro- nization, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T01:50:59.876252Z"},"links":{"citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:5d066b60c2caed66d46a18bacf0e90b0bc9e62471aa2b2e7881b9b01e369d42a","observation_id":"418cd17a-d556-40e1-8eae-683d909792ad","resolution":{"observed_at":"2026-08-03T01:50:59.876252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:51:00.058226Z","title":"MOVA: Towards scalable and synchronized video-audio generation, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T01:51:00.058226Z"},"links":{"citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:1249bf5f6f9a21e86b611a7b663cd9afc657d1dc09872421490d6509725f0268","observation_id":"caa853c6-7d08-49ee-a873-848a57706c12","resolution":{"observed_at":"2026-08-03T01:51:00.058226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:51:00.009008Z","title":"LTX-2: Efficient joint audio-visual foundation model, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T01:51:00.009008Z"},"links":{"citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:991e13e7169e02bef387b44ad2c3242e3c61360eeb673982d63c463bc7ed11df","observation_id":"1acf9e11-fef4-4762-864b-c2ba78f7c000","resolution":{"observed_at":"2026-08-03T01:51:00.009008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:51:00.206338Z","title":"Rep- resentation alignment for generation: Training diffusion transformers is easier than you think","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T01:51:00.206338Z"},"links":{"citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:6f8e9af8e47ee960acaf19dfd7d70462b6e7f068bab0eb846a1d7746da43f02c","observation_id":"8a89e8ce-6141-4927-ab1e-00ef378e3e35","resolution":{"observed_at":"2026-08-03T01:51:00.206338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:51:00.124013Z","title":"Wan2.2-T2V-A14B model card","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T01:51:00.124013Z"},"links":{"citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:1bf8f8fe888efa4ca3732a396aec8c632c65d1e33126c4d1eab3e75d5bd4d963","observation_id":"25f649a4-0a53-4691-8c6d-e7ed0adf4c2b","resolution":{"observed_at":"2026-08-03T01:51:00.124013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:51:00.360367Z","title":"Efros, Eli Shechtman, and Oliver Wang","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T01:51:00.360367Z"},"links":{"citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:65c667bad7bed8ed634eddcbbd9481c5df1f2edd917ebb3b568d06114ddcf596","observation_id":"d1900e63-3023-4997-8c15-883fd06e9243","resolution":{"observed_at":"2026-08-03T01:51:00.360367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:51:00.271601Z","title":"What matters for representation alignment: Global information or spatial structure?, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T01:51:00.271601Z"},"links":{"citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:2b22d39aeed0240ed4e5310d539af4671332b7852c1355d28395e891b87e86eb","observation_id":"ca114542-a971-4ab7-9cda-9b701c9b95d1","resolution":{"observed_at":"2026-08-03T01:51:00.271601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:51:00.544877Z","title":"Gemmeke, Daniel P","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T01:51:00.544877Z"},"links":{"citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:493b88cfc7f01116b643be634f549b034c2035b85324023d8701ec05f27bb45f","observation_id":"c1be5cbd-a4f5-4885-a934-f673833d93e6","resolution":{"observed_at":"2026-08-03T01:51:00.544877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-02T19:02:22.939940Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-03T01:51:00.418732Z","title":"BEATs: Audio pre-training with acoustic tokenizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T01:51:00.418732Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:45a3071efe3cad382f154446fd4848339e5cc7542c0cd2868d0f4c337ad5feff","observation_id":"3cdad4a4-601b-452a-afb4-4458397ec441","resolution":{"observed_at":"2026-08-03T01:51:00.418732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-03T01:51:00.729036Z","title":"UCF101: A dataset of 101 human actions classes from videos in the wild, 2012","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T01:51:00.729036Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:298d92caf2acbf5a36ebcac7bcd70e3e9c6339922447b498bc8e3a3f49421508","observation_id":"8ce5ffb6-5ac8-47f8-80a3-e747aa20f0e6","resolution":{"observed_at":"2026-08-03T01:51:00.729036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:51:00.634694Z","title":"Qwen3.5: Towards native multimodal agents, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T01:51:00.634694Z"},"links":{"citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:0a0c014b6199207aec9482872e66ed8dfbbd10b32cbddb7decb100a2af00361a","observation_id":"49a66139-33f0-48e3-be67-1d7851216126","resolution":{"observed_at":"2026-08-03T01:51:00.634694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:51:00.962236Z","title":"LibriSpeech: An ASR corpus based on public domain audio books","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T01:51:00.962236Z"},"links":{"citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:6b1d689ecc00724702e0a7682ea5141bcc82e6c881127fc83ad9045e009c41c8","observation_id":"fae64e3d-4093-4708-bc11-4c0930228803","resolution":{"observed_at":"2026-08-03T01:51:00.962236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:51:00.888437Z","title":"Panda-70M: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T01:51:00.888437Z"},"links":{"citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:72f23327e0b033b55ba9cbb3eafe10c8608ebe5218630f75a54b255a78d5faca","observation_id":"f8fdcd0a-d5ec-4d00-bd86-7db18e700773","resolution":{"observed_at":"2026-08-03T01:51:00.888437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:51:01.215735Z","title":"Parker, Matthew Rice, CJ Carr, Zack Zukowski, Josiah Taylor, and Jordi Pons","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T01:51:01.215735Z"},"links":{"citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:7cf69a501b6b77d2d671720ef69c2738a5a1d8bdb886255aad577139d8159d20","observation_id":"40bc4501-15fe-44f1-ad95-1c5d689f1cb4","resolution":{"observed_at":"2026-08-03T01:51:01.215735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:51:01.120402Z","title":"The MUSDB18 corpus for music separation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T01:51:01.120402Z"},"links":{"citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:4b16dc1ea0373a10f1e66c2c27d37aa3322c331069b786afe8535b0189f1840c","observation_id":"c461c2d0-a264-46cc-9259-24ad685b063e","resolution":{"observed_at":"2026-08-03T01:51:01.120402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07055","last_updated":"2022-10-13T14:25:37Z","snapshot_observed_at":"2026-07-06T14:04:47.954764Z","submitted_at":"2022-10-13T14:25:37Z","title":"Sparse in Space and Time: Audio-visual Synchronisation with Trainable Selectors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07055","snapshot_observed_at":"2026-08-03T01:51:01.639669Z","title":"Sparse in space and time: Audio-visual synchroni- sation with trainable selectors","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T01:51:01.639669Z"},"links":{"cited_paper":"/paper/2210.07055","citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:ce40ad73ac7b6f6786365ee7c7d77aec077a3505c7825604766de216c066f59d","observation_id":"21161479-4a3c-482d-ba48-e507aec59e1c","resolution":{"observed_at":"2026-08-03T01:51:01.639669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05139","last_updated":"2025-02-07T18:15:57Z","snapshot_observed_at":"2026-07-06T20:33:01.960703Z","submitted_at":"2025-02-07T18:15:57Z","title":"Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05139","snapshot_observed_at":"2026-08-03T01:51:01.799954Z","title":"Metaaudioboxaesthetics: Unifiedautomatic qualityassessmentforspeech,music,andsound","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T01:51:01.799954Z"},"links":{"cited_paper":"/paper/2502.05139","citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:43bc4fa6935b44c7f3a3c9963f970c5bc08d54fd7cfebb4b67786056929d7806","observation_id":"bf7e1cdb-655d-47ae-bc6f-20dc5ede3e92","resolution":{"observed_at":"2026-08-03T01:51:01.799954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:51:01.477177Z","title":"VGGSound: A large-scaleaudio-visual dataset","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T01:51:01.477177Z"},"links":{"citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:20201c0a2ff3d15f07ac93bb7d711e4bd90627f1c8162c63b6db1fea78c69a39","observation_id":"ca8cbbe6-f844-4c67-b15f-830ea4881695","resolution":{"observed_at":"2026-08-03T01:51:01.477177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:51:01.976970Z","title":"Multi-task learning using uncertainty to weigh losses for scene geometry and semantics","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T01:51:01.976970Z"},"links":{"citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:6f43ca4ba34537f676863e5c15af4c1f85c1ef331c056048e7921d4f10dcf84d","observation_id":"43146570-5131-4033-93ae-b3197ea0369b","resolution":{"observed_at":"2026-08-03T01:51:01.976970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06155","last_updated":"2025-09-07T17:55:03Z","snapshot_observed_at":"2026-08-05T00:05:44.790684Z","submitted_at":"2025-09-07T17:55:03Z","title":"UniVerse-1: Unified Audio-Video Generation via Stitching of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06155","snapshot_observed_at":"2026-08-03T01:51:01.908095Z","title":"UniVerse-1: Unified audio-video generation via stitching of experts, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T01:51:01.908095Z"},"links":{"cited_paper":"/paper/2509.06155","citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:a0e0f90bbd2e37a0a5402d35d7179764e5bb0cdc8478193ba2033aff1ac28ec5","observation_id":"118dfa17-bd41-4389-ab74-5aae05eaebde","resolution":{"observed_at":"2026-08-03T01:51:01.908095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:50:57.814691Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T01:50:57.814691Z"},"links":{"citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:e5a39e037c23ab5b245199810ff2229442b6557bda2c957f253fdb188de59c57","observation_id":"7dee2a1a-47b2-437d-bb24-c1d1b052b0d3","resolution":{"observed_at":"2026-08-03T01:50:57.814691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.17991","last_updated":"2026-05-18T07:47:03Z","snapshot_observed_at":"2026-08-02T09:43:03.899871Z","submitted_at":"2026-05-18T07:47:03Z","title":"Stable Audio 3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.17991","snapshot_observed_at":"2026-08-03T01:51:01.349808Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-03T01:51:01.349808Z"},"links":{"cited_paper":"/paper/2605.17991","citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:5a9a56611bc77e8fa70ca5547bd21eb357fba4fdc721c27fd79ef7790f87adc6","observation_id":"8a027708-046b-4f67-8d43-77234f34fa63","resolution":{"observed_at":"2026-08-03T01:51:01.349808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-05T07:18:04.703642Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2607.23855."}