Pith. sign in

Paper Citation Record · LEDGER

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing

As of 22 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 8 inbound Pith citation observations for arXiv:2512.13677.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2512.13677 v2

Coverage vector

measured 54 of 54 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-03T16:26:00.285585Z

measured 62 of 62 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-22T06:32:14.747728+00:00

measured 8 of 8 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-06T00:31:25.312050Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-05T12:41:04.375376Z

Reference resolution

54 of 54 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved54
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation b83231be-d556-495e-bca1-e9f384e77472 · outbound

This paper cites Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:53.994887Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:53.994887Z digest=sha256:1c48061548d98fb8163ebb6339012ad2284654183b204c797075c0e500f8c6e6

Observation 2818ee41-0988-4952-81f6-d2edff52087b · outbound

This paper cites HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:54.145826Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:54.145826Z digest=sha256:51c3a857f87ee3218dc4f191895a090234560185b36a13368dad685f95dab4e0

Observation 935e2106-9a9f-41df-b2d6-650d550ed0ae · outbound

This paper cites Mmaudio: Taming multimodal joint training for high-quality video-to-audio synthesis.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Mmaudio: Taming multimodal joint training for high-quality video-to-audio synthesis

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:54.310475Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:54.310475Z digest=sha256:67873bd44df4889619ac6187d3695a655d56f566c8aad298d502c713f65ebf21

Observation d57b0d29-2d33-4b37-8203-aba4a80749cc · outbound

This paper cites UniMax: Fairer and more Effective Language Sampling for Large-Scale Multilingual Pretraining.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing UniMax: Fairer and more Effective Language Sampling for Large-Scale Multilingual Pretraining

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:54.531863Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:54.531863Z digest=sha256:55867978c66e75fff99b7515f1a0a31bb13400840c195194babb6e95f597bcda

Observation a8853a92-b483-46c6-86d2-74c9621b13c9 · outbound

This paper cites Out of time: automated lip sync in the wild.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Out of time: automated lip sync in the wild

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:54.730459Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:54.730459Z digest=sha256:a8532d550574bdf8ce6fae1fb6f33f82dc4f04508b6c569f04fdcefdea7827c1

Observation aff03e9e-1449-4dfd-a312-d23a650ece39 · outbound

This paper cites Wan2.5.https://wan.video/, 2025.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Wan2.5.https://wan.video/, 2025

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:54.827406Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:54.827406Z digest=sha256:3580859b0bcfb35f0152cce514577474f1b2de89f24b8c5861228ec86c924354

Observation cfa242a5-ea45-4b8d-8504-44c2213035b3 · outbound

This paper cites Veo3.https://deepmind.google/models/veo/, 2025.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Veo3.https://deepmind.google/models/veo/, 2025

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:54.934432Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:54.934432Z digest=sha256:7cb565197d8e9688fd3e56028cab0d5c77922a2d2ed8cfca77fdbe68500e92eb

Observation 23c081a3-7633-48cd-be2c-102805c73517 · outbound

This paper cites Clotho: An audio captioning dataset.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Clotho: An audio captioning dataset

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:55.065359Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:55.065359Z digest=sha256:1756c694ffea3f19fa8df7eedc5028a673eb746fd5e0ae1c8de04f61c2468016

Observation 83a2e068-c7a7-4f7b-ba91-9281acb8b475 · outbound

This paper cites Scaling rectified flow transformers for high-resolution image synthesis.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Scaling rectified flow transformers for high-resolution image synthesis

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:55.273666Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:55.273666Z digest=sha256:e45920dbd572faeb99af30d12f3934c2a1e39f98447100cde9b73815339b7126

Observation 10a0ad3d-c642-4bd7-b316-333a7b4bf0a9 · outbound

This paper cites OmniAvatar: Efficient Audio-Driven Avatar Video Generation with Adaptive Body Animation.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing OmniAvatar: Efficient Audio-Driven Avatar Video Generation with Adaptive Body Animation

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:55.436179Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:55.436179Z digest=sha256:da98155ffe5b852df347f6fa7f07c489160df9a5c45d0b0230f58f5f654f6626

Observation f1e3d810-2745-4a83-8ad8-805a95a82067 · outbound

This paper cites Wan-S2V: Audio-Driven Cinematic Video Generation.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Wan-S2V: Audio-Driven Cinematic Video Generation

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:55.546710Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:55.546710Z digest=sha256:46c5f8d5d1816aaa0b358ed70e81131ba1eeafe70152ed82cb1570117eb2688f

Observation 0dedc90e-dc1b-43f1-b792-0ce29ca42ea7 · outbound

This paper cites Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:55.712311Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:55.712311Z digest=sha256:5b6d87608022bdeea1389a72642977310c6e0d7c982396405f42b63767bd4521

Observation 7ae5821c-dec4-4de1-bb54-c93df909c2ee · outbound

This paper cites ACE-Step: A Step Towards Music Generation Foundation Model.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing ACE-Step: A Step Towards Music Generation Foundation Model

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:55.887395Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:55.887395Z digest=sha256:a72800c4b8c4af936818f1e828e86625c27ba7f788c9fe53f21cf06c238f81e8

Observation 16755c82-6b7f-4480-9a83-682402e864d4 · outbound

This paper cites AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:56.032167Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:56.032167Z digest=sha256:66c2892daa22bbd343c56af9c68519c7e024883bb8c785744f5f00aac23dfb5d

Observation 96a44fdf-00a6-40bc-8e5d-41ecf84ffd9c · outbound

This paper cites Classifier-Free Diffusion Guidance.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Classifier-Free Diffusion Guidance

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:56.183618Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:56.183618Z digest=sha256:6f921c935411c8f99521b94db1185b638fa6ca0bd2d4d003c99ca77c7f9e709d

Observation cee6463b-6430-4500-a5af-9c211722155e · outbound

This paper cites A Simple but Strong Baseline for Sounding Video Generation: Effective Adaptation of Audio and Video Diffusion Models for Joint Generation.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing A Simple but Strong Baseline for Sounding Video Generation: Effective Adaptation of Audio and Video Diffusion Models for Joint Generation

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:56.290355Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:56.290355Z digest=sha256:9d6f5e44203281b2ac746f7879eedafc334364fee19c80cacc2e3c27cd2be9b4

Observation d3d0283c-3482-443b-8a3a-a6c00bac2951 · outbound

This paper cites Musiq: Multi-scale image quality transformer.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Musiq: Multi-scale image quality transformer

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:56.399787Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:56.399787Z digest=sha256:834f41bda315bb2f1ee0f4dd239c7d659708879c92d8ebb00990f48b9810ad19

Observation accb6232-f55c-403a-b743-a096b1edbb8d · outbound

This paper cites Audiocaps: Generating captions for audios in the wild.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Audiocaps: Generating captions for audios in the wild

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:56.574327Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:56.574327Z digest=sha256:e3d21fea4d3bdd1127fa5e12d9b894c921031651b87818e71aeedc9d5ad349ce

Observation 834b6cf6-fc56-4714-9886-927c91e9f777 · outbound

This paper cites Panns: Large-scale pretrained audio neural networks for audio pattern recognition.TASLPRO, 2020.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Panns: Large-scale pretrained audio neural networks for audio pattern recognition.TASLPRO, 2020

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:56.653546Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:56.653546Z digest=sha256:dc36e91ee146cac0826c5f0fed785d2efba89017edb2719fd1085bc322a9de56

Observation 11c20f79-fd10-4c1e-b34b-bba0579a3fc9 · outbound

This paper cites HunyuanVideo: A Systematic Framework For Large Video Generative Models.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing HunyuanVideo: A Systematic Framework For Large Video Generative Models

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:56.736283Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:56.736283Z digest=sha256:8bfdc707ea49a76711c57e08ea17cb2b2eaecd41bb62740527b1f5835e4f21ad

Observation d88f42e7-2290-47d5-b122-5dc5d3a2c19f · outbound

This paper cites Efficient Training of Audio Transformers with Patchout.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Efficient Training of Audio Transformers with Patchout

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:56.830276Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:56.830276Z digest=sha256:b022032936f43a09f1357f0cc2f500ecb62d554eba549a43d37ee1872b87b445

Observation 4fd660bf-dc2f-47c7-a7db-6010fe912ec8 · outbound

This paper cites OmniHuman-1: Rethinking the Scaling-Up of One-Stage Conditioned Human Animation Models.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing OmniHuman-1: Rethinking the Scaling-Up of One-Stage Conditioned Human Animation Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:56.942377Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:56.942377Z digest=sha256:10cc2941e09a5133f03e0bf3a4bef5541ae746eee790efec02d3911456536538

Observation 3bf3a7e8-b71c-41e3-8bda-8ebd4f354554 · outbound

This paper cites Flow Matching for Generative Modeling.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Flow Matching for Generative Modeling

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:57.046712Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:57.046712Z digest=sha256:5e4645ccae03d838d54a599f1d2deb2bda141bfbf270ed6c18c060da92492321

Observation 285ce9c0-83cd-4b94-97cd-2a3c479351a1 · outbound

This paper cites Javisdit: Joint audio-video diffusion transformer with hierarchical spatio-temporal prior synchronization.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Javisdit: Joint audio-video diffusion transformer with hierarchical spatio-temporal prior synchronization

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:57.115445Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:57.115445Z digest=sha256:f0e44dab498123fc653c8eed30bf5ceae2b275a3e56fba72b6f340b83637417d

Observation 6d5f3efb-364d-4b6e-b5f0-50642d1d0df1 · outbound

This paper cites Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:57.224612Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:57.224612Z digest=sha256:15181f510af5bd065ee912ff16638ebbbe4b3abbcbe342b69d00c2f8ac828f86

Observation 79ff5cde-cdb9-4555-b3dc-0d72394d7751 · outbound

This paper cites Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:57.336256Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:57.336256Z digest=sha256:499611193208722dee521c8e42d9404f54315fb4edce728882d23f1cc9202838

Observation dfa016d6-3512-4940-bc74-a4df94e98d23 · outbound

This paper cites Diff-foley: Synchronized video-to-audio synthesis with latent diffusion models.NeurIPS, 2023.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Diff-foley: Synchronized video-to-audio synthesis with latent diffusion models.NeurIPS, 2023

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:57.443780Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:57.443780Z digest=sha256:2f3e50885d28fc2f543a657c56ee610f9db9c4bd407c8d97ca8b2d7f77f566bb

Observation c6557d60-88be-4a3c-a4e0-f3073bef3e71 · outbound

This paper cites Wavcaps: A chatgpt-assisted weakly-labelled audio captioning dataset for audio-language multimodal research.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Wavcaps: A chatgpt-assisted weakly-labelled audio captioning dataset for audio-language multimodal research

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:57.571217Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:57.571217Z digest=sha256:fc07a2bf32b292dc5d52208a2c8610e4c0faaa143362adb4797021f7c78c4bd8

Observation 474e3a89-80a7-420b-a03d-8e6aa4100e9d · outbound

This paper cites Sora2.https://openai.com/zh-Hans-CN/index/sora-2/, 2025.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Sora2.https://openai.com/zh-Hans-CN/index/sora-2/, 2025

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:57.752438Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:57.752438Z digest=sha256:c885b2c6c6fabc55347da1e10c5df7ad93905d57cdc8e0792dac042563628418

Observation eacb55e3-a723-4bd5-8f44-07b12faaa521 · outbound

This paper cites Scalable diffusion models with transformers.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Scalable diffusion models with transformers

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:57.834730Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:57.834730Z digest=sha256:41dbc46024d1a2e93c42e53de2b95e912df9ab0d5decb56bfbcba61472efc8c1

Observation 89690cbb-5a30-4057-b2aa-d2b740fcd615 · outbound

This paper cites Robust speech recognition via large-scale weak supervision.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Robust speech recognition via large-scale weak supervision

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:57.897622Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:57.897622Z digest=sha256:8e0a896cf55a68abf8aab21aae583136a7cf12bc74b36c28d3c3e2e69c0178d0

Observation d1a0b9b9-30a5-4662-9df1-5e55423b0535 · outbound

This paper cites U-net: Convolutional networks for biomedical image segmentation.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing U-net: Convolutional networks for biomedical image segmentation

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:58.028988Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:58.028988Z digest=sha256:42ce1fa6f206b5d36a42e49b70cd90efd2ca6bae151757576985f7132de03130

Observation 58fe299d-b20e-4aeb-888e-d8472845d91f · outbound

This paper cites Mm-diffusion: Learning multi-modal diffusion models for joint audio and video generation.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Mm-diffusion: Learning multi-modal diffusion models for joint audio and video generation

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:58.145178Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:58.145178Z digest=sha256:39735fc1671039b32e04278a14fa0069c664b4eaf2959a6b439f99d3377e5dff

Observation 44ecad2f-0840-4635-9386-8dd77c7ae7d4 · outbound

This paper cites HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:58.270794Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:58.270794Z digest=sha256:dbc2e05b34c1d05ba5a396eb2b54505f4a3144232397d655a68f2f35c51c73cc

Observation da686c8d-b660-4472-81d4-5c950e054d7b · outbound

This paper cites DINOv3.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing DINOv3

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:58.357377Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:58.357377Z digest=sha256:a5f0ce1502be32684432b2cd36844886ead9824927303768580cffe2060a7a92

Observation 1998f3a2-5d6f-4c6b-943a-f96ca72f0e5b · outbound

This paper cites Raft: Recurrent all-pairs field transforms for optical flow.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Raft: Recurrent all-pairs field transforms for optical flow

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:58.480419Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:58.480419Z digest=sha256:f459cf82110224c88b3fff8f50fccc0fb9d71f0222e71daa1f139ec435656061

Observation 62d3aea7-532b-462f-a0df-bdb4706434f2 · outbound

This paper cites Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:58.606661Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:58.606661Z digest=sha256:a24422e6d65e0cd875a25ab7797baefd1b9f6656ce56055e432a0d14edaef861

Observation cb05a9c8-7e16-421e-bb07-23ee8354420b · outbound

This paper cites Wan: Open and Advanced Large-Scale Video Generative Models.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Wan: Open and Advanced Large-Scale Video Generative Models

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:58.675273Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:58.675273Z digest=sha256:e5aeccf5b5ea849c4273b1186523dd9fbf618ba317f42b05e33b7ddd782c3461

Observation 57ea88af-15b7-443b-b837-fa61829a4c83 · outbound

This paper cites UniVerse-1: Unified Audio-Video Generation via Stitching of Experts.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing UniVerse-1: Unified Audio-Video Generation via Stitching of Experts

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:58.726931Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:58.726931Z digest=sha256:b823cd3463b5b1c1d78ee20f7a1bac7ba4df28645f421cdeaed88ba7352d6785

Observation bf7f4057-b622-4a49-ab4a-43c4f13fc4c2 · outbound

This paper cites Kling-foley: Multimodal diffusion transformer for high-quality video-to-audio generation.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Kling-foley: Multimodal diffusion transformer for high-quality video-to-audio generation

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:58.763471Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:58.763471Z digest=sha256:8af2ffaa15d6be50374be12097742bcfbe07eca5681896602c33325ec70fc5f9

Observation caab88d7-d3bc-457d-ba24-7955d5933cb6 · outbound

This paper cites Av-dit: Taming image diffusion transformers for efficient joint audio and video generation.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Av-dit: Taming image diffusion transformers for efficient joint audio and video generation

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:58.776199Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:58.776199Z digest=sha256:dc369a509c317db8cf31d2bba5c3bd13f133e9e79879d9a8abcda30ff3a8dba2

Observation 5db16c02-bee4-4b43-8764-32f82764cc54 · outbound

This paper cites AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:58.872482Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:58.872482Z digest=sha256:307765b12cef01bb70dd05118f977bee34800543aa213d643593ee9fd2cc4f24

Observation 6fbe48f2-9e25-4364-a75e-8b7cebdb85f4 · outbound

This paper cites Fantasytalking: Realistic talking portrait generation via coherent motion synthesis.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Fantasytalking: Realistic talking portrait generation via coherent motion synthesis

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:58.948739Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:58.948739Z digest=sha256:4cad1dc7e1cab148f5bc75fba7441de0d47db497d09f3b986675bcf6146722fd

Observation 7ffc17f1-87cf-46b9-890f-4755ca5b67c0 · outbound

This paper cites InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:59.060875Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:59.060875Z digest=sha256:b713ff5f1541d5a7e77f3e5993304b1c610d60bb6a0f80d8acfb1de65362120e

Observation b7b54d83-a12a-48b5-b8e2-e59d7e19407d · outbound

This paper cites Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:59.152970Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:59.152970Z digest=sha256:7eb6c03876077bd33f7a21d322a53fe8008ca7cb329816f6b73e71ac2becd5d9

Observation 6b018707-b816-462a-aac6-27b64fe7b027 · outbound

This paper cites Seeing and hearing: Open-domain visual-audio generation with diffusion latent aligners.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Seeing and hearing: Open-domain visual-audio generation with diffusion latent aligners

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:59.307542Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:59.307542Z digest=sha256:4430de60f39053c0f3b599f15d78bd1daa7c81df6096b449e5e80acac62abefb

Observation 102b32df-884b-43d1-b960-e2d78ecd357d · outbound

This paper cites Qwen2.5 Technical Report.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Qwen2.5 Technical Report

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:59.436247Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:59.436247Z digest=sha256:1481e60221b510dd9dcdb269a21c3c965e8fb5b92d737eb2b8c09587ba9fdc4b

Observation 7fec9ff2-183b-46a0-8969-c4bbb43d83ab · outbound

This paper cites Maniqa: Multi-dimension attention network for no-reference image quality assessment.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Maniqa: Multi-dimension attention network for no-reference image quality assessment

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:59.576862Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:59.576862Z digest=sha256:ff1d1467cb38d4ebef4c88ce25938ea52e453027c9cb670f311bb1869c2cc0f1

Observation d3a5c374-d6a5-4f20-8374-6f3f60c15a09 · outbound

This paper cites CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:59.692876Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:59.692876Z digest=sha256:5951202d72fd0eb2116d6c66e83485aaae70a2db7adfd887536bc65f1d50a34d

Observation d8945482-6b3c-4c05-8c01-c345ae36d1ed · outbound

This paper cites Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:59.808955Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:59.808955Z digest=sha256:11bbb7b563edf0af338b854c46a92f28a81f13813d496d9dc608fac560faf80d

Observation 1a7707f2-2d37-44f4-9fee-803663185f88 · outbound

This paper cites Uniavgen: Unified audio and video generation with asymmetric cross-modal interactions.arXiv preprint arXiv:2511.03334, 2025.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Uniavgen: Unified audio and video generation with asymmetric cross-modal interactions.arXiv preprint arXiv:2511.03334, 2025

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:59.923575Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:59.923575Z digest=sha256:34d7bba583a55cdde5832fd491cb11906a0a7acda8f078dc0174ad2e9f9eeffe

Observation 69a06d9f-05bd-435d-9b0d-efe3bfd608a5 · outbound

This paper cites Waver: Wave Your Way to Lifelike Video Generation.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Waver: Wave Your Way to Lifelike Video Generation

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-03T16:26:00.037365Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:26:00.037365Z digest=sha256:6047d667fcf1f40378f65bc21e62d46fbb31cf90ac140af93d0ab87ad2aa8b0a

Observation fd5b86f8-7e4b-42c5-aa90-1aaa05de5c4d · outbound

This paper cites FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-03T16:26:00.172036Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:26:00.172036Z digest=sha256:95c2d6c7c11b7e84d87f3eb074b1ea0e2a93a40135882bba8637df244f41e41f

Observation 83f1c4a2-278e-4948-ad99-b96b99a7765a · outbound

This paper cites Uniform: A unified diffusion transformer for audio-video generation.arXiv e-prints, 2025.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Uniform: A unified diffusion transformer for audio-video generation.arXiv e-prints, 2025

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-03T16:26:00.285585Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:26:00.285585Z digest=sha256:3e7ad016ea41936beff73ca181d20f47d008017553ef8fda191961b6ddd9cc55

Pith citing papers

Observation 039d90a1-8358-47fe-a869-deab40f14716 · inbound

Tora3: Trajectory-Guided Audio-Video Generation with Physical Coherence cites this paper.

Tora3: Trajectory-Guided Audio-Video Generation with Physical Coherence JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing

Reference 18

Resolution
verified exact
arxiv_id, observed 2026-08-03T03:15:29.416338Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-05-10T17:13:06.005185Z digest=sha256:7074c28f76063ae37fa1073df23cf13409737f1e15fbadf2f80c26718b2b44f3

Observation 106168a0-6b39-4c67-a652-01b39ba9afa4 · inbound

OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation cites this paper.

OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing

Reference 25

Resolution
verified exact
arxiv_id, observed 2026-08-03T03:15:29.416338Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-05-10T15:09:02.727887Z digest=sha256:6c95e0bb554b058bb5036ed8ac191166de64f25e3952da2d7c25b6d82bd95514

Observation c01f1bf5-3a78-4e08-b828-3d6f4c924adb · inbound

OmniHuman: A Large-scale Dataset and Benchmark for Human-Centric Video Generation cites this paper.

OmniHuman: A Large-scale Dataset and Benchmark for Human-Centric Video Generation JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing

Reference 19

Resolution
metadata mismatch
arxiv_id, observed 2026-08-03T03:15:29.416338Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-05-10T05:19:49.671136Z digest=sha256:59fadb8fccbadd5b9502bf4aaa891bfae6acda802179f747112955eddd6343f6

Observation 81c0ff12-b1ad-4d20-94d9-b90843758d4a · inbound

OmniHuman: A Large-scale Dataset and Benchmark for Human-Centric Video Generation cites this paper.

OmniHuman: A Large-scale Dataset and Benchmark for Human-Centric Video Generation JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing

Reference 19

Resolution
metadata mismatch
arxiv_id, observed 2026-08-03T03:15:29.416338Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-07-05T12:34:41.758238Z digest=sha256:08a08834edea5d25cfc2587cfdf8332627c30d5fcd0a832cbba57b1bff346113

Observation 19ec8ee7-9b08-4f8c-8865-d6376b661e51 · inbound

Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation cites this paper.

Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing

Reference 24

Resolution
verified exact
arxiv_id, observed 2026-08-03T03:15:29.416338Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-05-07T16:54:23.108142Z digest=sha256:57eeaf07714d95260568cfe53012d03c0e42de25d3b5a8765526d7536acdbc4b

Observation 5dc8bbe9-ae49-4ffe-8850-c4b2235f4e8d · inbound

SyncDPO: Enhancing Temporal Synchronization in Video-Audio Joint Generation via Preference Learning cites this paper.

SyncDPO: Enhancing Temporal Synchronization in Video-Audio Joint Generation via Preference Learning JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-08-03T03:15:29.416338Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-05-13T07:01:40.333448Z digest=sha256:0a4c4e505b7edcff6857964ab4ed63e64f3f51ee412b50e710e071ee1852f816

Observation 41339ad0-1024-4195-90ff-7285d7d83b7c · inbound

From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning cites this paper.

From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing

Reference 133

Resolution
verified exact
arxiv_id, observed 2026-08-03T03:15:29.416338Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-07-02T05:52:55.818877Z digest=sha256:7dafc13b8098d42e704a263979215d14cfadbdb8b9e9f15258696b2bbe152219

Observation aea12b69-b143-4357-b0b3-44190be7bb0e · inbound

InteracVid: Building a Real Interactive Audio-Visual Response Dataset from Live-Chat Videos cites this paper.

InteracVid: Building a Real Interactive Audio-Visual Response Dataset from Live-Chat Videos JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-06T00:31:25.312050Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T00:31:25.312050Z digest=sha256:2ddbe6221640fc0e06fe956de2d6a89585c8495fb0197a528e7651cb6e12f1b3