Pith. sign in

Paper Citation Record · LEDGER

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation

As of 13 August 2026, this Paper Citation Record lists 100 of 105 outbound references and 1 inbound Pith citation observation for arXiv:2412.15191.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2412.15191 v2

Coverage vector

measured 100 of 105 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-11T11:38:08.713130Z

measured 101 of 101 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-12T06:34:41.77262+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-03T16:25:56.032167Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

100 of 105 outbound references displayed

  • verified exact3
  • verified fuzzy39
  • unresolved58
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation d296dfca-7f78-4ed4-ad45-9d27d9470b9d · outbound

This paper cites Vid- styleode: Disentangled video editing via stylegan and neu- ralodes.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Vid- styleode: Disentangled video editing via stylegan and neu- ralodes

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.104515Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.104515Z digest=sha256:3f5ea8e41aff518ebda1f8c0367cfdb4f6382eb3336f50ed5e0846c74fda52b6

Observation d9359a8d-e7c7-4f8d-ab45-c9513933f26d · outbound

This paper cites Label-Efficient Semantic Segmentation with Diffusion Models.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Label-Efficient Semantic Segmentation with Diffusion Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.110731Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.110731Z digest=sha256:ac94bf88f3574bed3836e451505fc8cd55367a31e400ddc687d74d12c2cdb8fa

Observation d83f8c8f-4a5a-4581-83f9-9467f2cdbec1 · outbound

This paper cites SonicDiffusion: Audio-Driven Image Generation and Editing with Pretrained Diffusion Models.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation SonicDiffusion: Audio-Driven Image Generation and Editing with Pretrained Diffusion Models

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.116734Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.116734Z digest=sha256:b013a417b5ce5b8f7d2c6a245a21cc86d93d41dcad4673d9f566dd91282a77b9

Observation 5d15ec61-52dc-4fb9-9dc3-41e1931aa447 · outbound

This paper cites Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.122293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.122293Z digest=sha256:ea6e341f0cdea003fdf5ffb68a522196a511d41788225e9dd64ecbaffc79b621

Observation c14217bb-83e5-40f8-8dfb-f277c4c48743 · outbound

This paper cites Align your latents: High-resolution video synthesis with latent diffusion models.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Align your latents: High-resolution video synthesis with latent diffusion models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.128519Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.128519Z digest=sha256:0fbfb74afa9fe706b0cd6b60cc7aa5ba3d464de7edc1f8dca1d69ce0e7e7a1a1

Observation 190444a4-fb82-4e21-a2f1-f5700c7d9b94 · outbound

This paper cites The mtg-jamendo dataset for au- tomatic music tagging.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation The mtg-jamendo dataset for au- tomatic music tagging

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.134204Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.134204Z digest=sha256:bb3fe9d9aecf9bf7dd462ba0a56738e2e74b4115fef99a599be09b032f8dd9a9

Observation c7e5e277-678d-407e-9756-72b5901cfd16 · outbound

This paper cites Video generation models as world simulators.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Video generation models as world simulators

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.140769Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.140769Z digest=sha256:4f2f3b205dbe82d913442d6a302f6a35b40c104373664a279950aa446609e800

Observation c65a41bc-86c4-4fb1-8037-5e0af3aaae0e · outbound

This paper cites Ac- tion2sound: Ambient-aware generation of action sounds from egocentric videos.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Ac- tion2sound: Ambient-aware generation of action sounds from egocentric videos

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.146634Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.146634Z digest=sha256:d6a3d0f645efe120d26d6e01a46e5e65973718a7f27260dc0b843b9fa4bf9d85

Observation 7ebe36cc-7eac-4a74-8eff-e592fb698c62 · outbound

This paper cites Semantically consistent video-to-audio generation using multimodal language large model, 2024.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Semantically consistent video-to-audio generation using multimodal language large model, 2024

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.153035Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.153035Z digest=sha256:b62a49776d63b72d89c13bc88437a59d651effd117d3051fdd93536ab28f4201

Observation 53c66c15-5a4e-4dfa-a5b5-8d8d33eadb2e · outbound

This paper cites Vggsound: A large-scale audio-visual dataset.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Vggsound: A large-scale audio-visual dataset

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.159115Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.159115Z digest=sha256:4df84b0f6b197d7715769db3ecf4ba7560d31cc8cc1a9be7a8477dfcf08e08e4

Observation 8835410d-eec2-4e66-ad2a-9bdad8343a2e · outbound

This paper cites Beats: audio pre-training with acoustic tokeniz- ers.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Beats: audio pre-training with acoustic tokeniz- ers

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.164804Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.164804Z digest=sha256:3e44f7c4af1dae2874caffe68de8bd05910c2acf5062add1247491209326cfd4

Observation c2bbfb5e-8eed-417f-803c-5a30e08840e1 · outbound

This paper cites Panda-70m: Captioning 70m videos with multiple cross-modality teachers.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Panda-70m: Captioning 70m videos with multiple cross-modality teachers

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.170524Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.170524Z digest=sha256:7ebca7fc7a7936dcc0414d2958184d7de8d94505e3ef5d6785d7acdb2b34a8ca

Observation fa0388dc-d1d6-4625-bbb7-c2d912a3ecc3 · outbound

This paper cites Unrav- eling instance associations: A closer look for audio-visual segmentation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Unrav- eling instance associations: A closer look for audio-visual segmentation

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.175962Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.175962Z digest=sha256:4971ecab63dd7b95cae1eb6f0ec9f926046575c0552dcbd973b1b732cb66085e

Observation 0bf5ea14-9876-48ba-a115-d84c7c909ef7 · outbound

This paper cites Video-Guided Foley Sound Generation with Multimodal Controls.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Video-Guided Foley Sound Generation with Multimodal Controls

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.186627Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.186627Z digest=sha256:1ac79dea9fb4619424cc1f68db7f10372e9a712b0adcf436d500e94af87f60ff

Observation 38893e5b-74f9-4975-874b-f70ba02afcbf · outbound

This paper cites MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.191695Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.191695Z digest=sha256:a990598e001b3536046efe38c07b401eaf6f7149bf522556e7f9d0ed66dd6efe

Observation 87acbeb6-f1d4-46a6-8775-7cafb0fc1144 · outbound

This paper cites LoVA: Long-form Video-to-Audio Generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation LoVA: Long-form Video-to-Audio Generation

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.197220Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.197220Z digest=sha256:84fc0c3bb0ada5d91bbf967ebbc2bbd6d4cd4428d35b6fce382b24e20ec6c133

Observation 4da5ae48-9c18-40cb-82d2-614b52eedfef · outbound

This paper cites Visionllama: A unified llama backbone for vision tasks.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Visionllama: A unified llama backbone for vision tasks

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.203510Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.203510Z digest=sha256:7e3186e1de266ab65923bc619a58a052eff801882252714d66148f9c27f99d0b

Observation c916368b-5b23-488c-a859-6da8e0700625 · outbound

This paper cites FMA: A dataset for music analysis.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation FMA: A dataset for music analysis

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.208913Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.208913Z digest=sha256:c66ec834ac5f6c9976ee50403bbbc7b4390c44023091939c99f963a981239346

Observation 86aac1ef-94e9-4e15-85ee-20240d518095 · outbound

This paper cites Conditional generation of audio from 9 video via foley analogies.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Conditional generation of audio from 9 video via foley analogies

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.214386Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.214386Z digest=sha256:081d9e075de41158743cfe133628eea147c44ac15c3d4e03e62019cf5a372e9c

Observation b9f203f6-1502-4a60-bcf1-3cf0536f07b2 · outbound

This paper cites Clap learning audio concepts from natural language supervision.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Clap learning audio concepts from natural language supervision

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.219790Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.219790Z digest=sha256:9474676e230c1e76d77fd402bc1874895f32753898cbfa545c4a26cee4da4317

Observation 58dad096-f52e-43dd-b2a4-f5763cc6b66d · outbound

This paper cites Scaling recti- fied flow transformers for high-resolution image synthesis.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Scaling recti- fied flow transformers for high-resolution image synthesis

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.225668Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.225668Z digest=sha256:03cc2d214a0f70d513213557fa7db7e87727b13f38e6ad4abc793661997e35e2

Observation 27cada57-4874-4724-b88c-288452bc6502 · outbound

This paper cites Hawley, and Jordi Pons.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Hawley, and Jordi Pons

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.231204Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.231204Z digest=sha256:aa4b0636f0ad38fdb0775cb472aa481ad010688e63548bc9d2f53d20901e3251

Observation c3df8024-a0d7-430d-b42f-f96de7d39de6 · outbound

This paper cites Gemmeke, Daniel P.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Gemmeke, Daniel P

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.236538Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.236538Z digest=sha256:61b7d97bdb28b4e7fbc0ad338fd0eeeec078738f68ba585d36ef4d1fe04b2358

Observation 345df0a7-7b26-43f5-9dd4-d4e26beb1806 · outbound

This paper cites Imagebind: One embedding space to bind them all.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Imagebind: One embedding space to bind them all

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.241917Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.241917Z digest=sha256:b5d1587083b2d88b46361bf76485944265a9b54b6af23f8dbb2b3e37d20df78e

Observation b9f57ae0-859d-4f53-97c0-5ea1ff617699 · outbound

This paper cites Gotta Hear Them All: Towards Sound Source Aware Audio Generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Gotta Hear Them All: Towards Sound Source Aware Audio Generation

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.247422Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.247422Z digest=sha256:40f3e2886b1d18bfddeeeebd997baa08f1817455b712a4cc45c34cb92f3a6fe2

Observation 1077e4aa-094b-498e-829b-60aa55850084 · outbound

This paper cites Taming Data and Transformers for Audio Generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Taming Data and Transformers for Audio Generation

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.253139Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.253139Z digest=sha256:e55c8a8ce74efc24465a19c9e5d6f0ad4f51d7e20535fcff4962dc49bc2ff344

Observation 0d3c1d2f-5b50-40de-90c7-60d7aa395fea · outbound

This paper cites MMDisCo: Multi-Modal Discriminator-Guided Cooperative Diffusion for Joint Audio and Video Generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation MMDisCo: Multi-Modal Discriminator-Guided Cooperative Diffusion for Joint Audio and Video Generation

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.258353Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.258353Z digest=sha256:97c8e1820a4cc1f6ff8471deab757dd49890df283f6aaf0b4696a116627b2b19

Observation ffdbda98-bd85-47f2-bea0-ddef94a55ac9 · outbound

This paper cites Unsupervised semantic correspondence using stable diffusion, 2023.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Unsupervised semantic correspondence using stable diffusion, 2023

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.264064Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.264064Z digest=sha256:fe1b62f9457cd337719d20bfc96bac3ee55467fedc068a28715c0a0b4501d693

Observation be0f8032-d1fe-4f88-9550-82f8162ab192 · outbound

This paper cites Gans trained by a two time-scale update rule converge to a local nash equi- librium.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Gans trained by a two time-scale update rule converge to a local nash equi- librium

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.269526Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.269526Z digest=sha256:739e489f5816ab3d2c7d725782788a4f0e7e1af62d7b656644f5861a0f1c03cd

Observation 1a14cfa0-667a-48ea-b424-a126158d8588 · outbound

This paper cites Classifier-free diffusion guidance.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Classifier-free diffusion guidance

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.274591Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.274591Z digest=sha256:cc21a0999521b91ac342e0d35e55a180fc6adff3189551818b9eaf1703f6c174

Observation d4a0bd31-d441-421b-984a-14c116f6da46 · outbound

This paper cites Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.280118Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.280118Z digest=sha256:be050d6002601a3ede9efef079883570b9a85da34b738d4b74f7afc71396722f

Observation 1ccb6364-d46c-4181-a344-f7ef90054b3e · outbound

This paper cites Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.285520Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.285520Z digest=sha256:4768a42bdab51b752538234bf0b350fb06d0f72f0edbd0811d630d22f95cc579

Observation fe63b53a-86be-461c-b420-be6531c6fe01 · outbound

This paper cites Epic-sounds: A large- scale dataset of actions that sound.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Epic-sounds: A large- scale dataset of actions that sound

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.291415Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.291415Z digest=sha256:57396578acbe6ead967d83af6d8918f8ecfa5272beb4b6b4f225081610ddfc5e

Observation 7c33fc9b-ae33-4f4f-ab48-15a4240349d6 · outbound

This paper cites Taming visually guided sound generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Taming visually guided sound generation

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.297020Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.297020Z digest=sha256:64bd7002c2ac469659cf90ce6691721df26c083d0fd2727d4f3f1766ab63e987

Observation 3f26d0e5-5a5e-488e-8b79-6cf965eb5261 · outbound

This paper cites A Simple but Strong Baseline for Sounding Video Generation: Effective Adaptation of Audio and Video Diffusion Models for Joint Generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation A Simple but Strong Baseline for Sounding Video Generation: Effective Adaptation of Audio and Video Diffusion Models for Joint Generation

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.302374Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.302374Z digest=sha256:42718b39846955fb47de52cbd168757eba59d4af6e1f65e8c20bfc4130ea52a7

Observation 0c023b92-9c29-49ac-8357-c674e1a97113 · outbound

This paper cites The power of sound (tpos): Audio reactive video generation with stable diffusion.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation The power of sound (tpos): Audio reactive video generation with stable diffusion

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.308086Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.308086Z digest=sha256:bfde79692642324a33c2c4d120272f881c6d692e8de4928ab7d83ba51c4bf994

Observation fdb49b99-ba46-41c2-b18e-c2843704a41d · outbound

This paper cites Pyramidal flow matching for efficient video generative modeling.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Pyramidal flow matching for efficient video generative modeling

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.313681Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.313681Z digest=sha256:1136e92af33a7bc883f96344461a52b7d84d41f8e20b092057f9b8294905f9ed

Observation 81065381-d8b1-453a-acf5-eb516161f96e · outbound

This paper cites Re- purposing diffusion-based image generators for monocular depth estimation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Re- purposing diffusion-based image generators for monocular depth estimation

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.320944Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.320944Z digest=sha256:1dfef3111ee874fd02642d8f9b872157cd2785cc1df91c9eda07167de923e1a5

Observation eb732a7a-d8e7-4279-98ef-4b1b9af7299d · outbound

This paper cites A Versatile Diffusion Transformer with Mixture of Noise Levels for Audiovisual Generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation A Versatile Diffusion Transformer with Mixture of Noise Levels for Audiovisual Generation

Reference 40

Resolution
verified exact
local_arxiv, observed 2026-08-11T11:38:09.436342Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.327784Z digest=sha256:16b46bad429cfef1e3c75a6f9b5d4e84fbf4f8572629e5a8d52a287a27f54705

Observation aee831d3-0c03-4500-8a2b-4639b39f53d8 · outbound

This paper cites Hifi-gan: Generative adversarial networks for efficient and high fi- delity speech synthesis.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Hifi-gan: Generative adversarial networks for efficient and high fi- delity speech synthesis

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.543955Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.333818Z digest=sha256:6af32dded48e95a6170d3d81f839cd8d5dfd25069d829f94419cf2ba6364bd98

Observation 52d52cb8-48a5-4be9-989e-07211047f4bf · outbound

This paper cites VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.339998Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.339998Z digest=sha256:6e2cb002991699eb7c50dafe45ae93a38c3374cb4c68b3b8a64a4c704b91982f

Observation 1da30b39-53eb-4a0e-b4a0-803257faffb9 · outbound

This paper cites Mandel, Mert Bay, and J.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Mandel, Mert Bay, and J

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.525705Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.345676Z digest=sha256:62f1993ee407b53e24a521aa56b72709c15b54c6065ee94bc816b9e83b401525

Observation a492f3c0-dc1a-4e96-b4ae-85b486274e10 · outbound

This paper cites Video-foley: Two-stage video-to-sound generation via tem- poral event condition for foley sound.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Video-foley: Two-stage video-to-sound generation via tem- poral event condition for foley sound

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.350927Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.350927Z digest=sha256:b38a28f3f4bd252d04a5774353b779e98b662bea6e432fb7a46a21fe58a3ec6f

Observation 08fb4f88-1400-45e6-9001-162a68cd3ee4 · outbound

This paper cites AADiff: Audio-Aligned Video Synthesis with Text-to-Image Diffusion.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation AADiff: Audio-Aligned Video Synthesis with Text-to-Image Diffusion

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.356490Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.356490Z digest=sha256:3da7ce145fccba353c6883a15b43ef59bfb441c973524a48a045474fac6ba65e

Observation 3f2d74c1-4fc9-4855-a314-b5d48a2cad39 · outbound

This paper cites Sound-guided semantic video generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Sound-guided semantic video generation

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.508429Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.362619Z digest=sha256:626b9f1892e0a4f6f545fda85c665e0722cc5f6105a70707663362b7857e1162

Observation cc3d2874-6914-43b0-8606-63c48b05cbaa · outbound

This paper cites T2v-turbo-v2: Enhancing video generation model post- training through data, reward, and conditional guidance de- sign.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation T2v-turbo-v2: Enhancing video generation model post- training through data, reward, and conditional guidance de- sign

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.368474Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.368474Z digest=sha256:7e9754849799732c451264e373f6e09415b5b8ff6da902cb6d2c827182699205

Observation 8665cc07-3bd3-474d-a636-d1a4e135c064 · outbound

This paper cites Ross, and Angjoo Kanazawa.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Ross, and Angjoo Kanazawa

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.490694Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.373866Z digest=sha256:d547455a367204c590d63907e036164193f812e0f6c220d19ac211825cdd41ad

Observation ccc2f29f-7925-4ba2-853c-5c31c45ebc5a · outbound

This paper cites MuVi: Video-to-Music Generation with Semantic Alignment and Rhythmic Synchronization.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation MuVi: Video-to-Music Generation with Semantic Alignment and Rhythmic Synchronization

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.379292Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.379292Z digest=sha256:60838c8aa5ea5fbc16b26dbc8b779e5bb443d9725a4d0e63502d870d4ef98e7f

Observation d6f3e263-0aaf-4035-863e-03ade21e1c34 · outbound

This paper cites Language-guided joint audio-visual editing via one-shot adaptation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Language-guided joint audio-visual editing via one-shot adaptation

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.473442Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.385173Z digest=sha256:886d7bcaabe3be7888e86fe8d8f02eae12079020007fd2f200e153e547b12746

Observation 5508d397-fdaa-414c-baa7-b7cd7b5b4e4f · outbound

This paper cites VMAS: Video-to-Music Generation via Semantic Alignment in Web Music Videos.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation VMAS: Video-to-Music Generation via Semantic Alignment in Web Music Videos

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.390974Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.390974Z digest=sha256:3f76288b7ffdf80d10434a2fe597d2c551c2e2d890670dda46b38810e46c7a63

Observation 81ff63fc-d68d-44a5-83c0-2d634979c4c9 · outbound

This paper cites Flow Matching for Generative Modeling.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Flow Matching for Generative Modeling

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.396773Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.396773Z digest=sha256:ddb3cc8d93388095ce72cd9878339c14459b4fbbbe0cb1e575601fb726feec74

Observation db5a51b4-dbb8-45b3-8626-b30f21889909 · outbound

This paper cites Plumbley.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Plumbley

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.454690Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.402890Z digest=sha256:cdf2c71c1430cdfda3f4d9379391f94bab5f7483b39af06a5af4f48119b1a3e2

Observation 836db613-10af-4d07-8f33-c24fcf3f0009 · outbound

This paper cites AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.409162Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.409162Z digest=sha256:cdb087da6c1ac8811b6297faeb5f084795eebabc1987b4ce88016f41aa8c4636

Observation 5d26fc6e-5f18-41e0-a3c4-a39b3e6bfd48 · outbound

This paper cites Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.415238Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.415238Z digest=sha256:270691bcb8b1aac361cc934a3c067b4a05791779e45f6285231efb9ca657bbc6

Observation 91f568f4-b8df-452d-91e9-eccbf1446a63 · outbound

This paper cites Diffusion hyperfeatures: Searching through time and space for semantic correspon- dence.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Diffusion hyperfeatures: Searching through time and space for semantic correspon- dence

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.437844Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.421089Z digest=sha256:295f8d159a57a00297ec33bcbde3df0b35f76bb4240d7a8c681821a1066365ab

Observation ce2c0459-1686-4549-b415-966e4ad8bdab · outbound

This paper cites Diff-foley: Synchronized video-to-audio synthesis with la- tent diffusion models.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Diff-foley: Synchronized video-to-audio synthesis with la- tent diffusion models

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.419482Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.426561Z digest=sha256:fe0b16148d39203c57ebfa033de66e198dd89540b8c898784875789523205a5c

Observation 4b19e8e2-9ce0-423b-a4dd-e5f6488c3d19 · outbound

This paper cites Videofusion: Decomposed diffusion models for high-quality video generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Videofusion: Decomposed diffusion models for high-quality video generation

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.400805Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.433111Z digest=sha256:6ca3acc442a5d43fa56dbdb96aeba7ff2e69cd02d8881c407d7f5044f09d0ef2

Observation ff0f5ce3-fe6e-47e0-821d-f298dac1f104 · outbound

This paper cites Tango 2: Aligning diffusion-based text-to-audio genera- tions through direct preference optimization.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Tango 2: Aligning diffusion-based text-to-audio genera- tions through direct preference optimization

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.383183Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.439491Z digest=sha256:0955e775b4940af540def4c69b14623fa71b819f921d9bb037c569762dd11433

Observation bd0a535c-367d-49a1-ac21-060fd96d3ee0 · outbound

This paper cites The song describer dataset: a corpus of audio captions for music-and-language evaluation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation The song describer dataset: a corpus of audio captions for music-and-language evaluation

Reference 60

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.365419Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.446429Z digest=sha256:62d0fc20d366acf50fd1ea6b66bbdd28127efa51a53be6e2693ed820c825635b

Observation 7f424f3d-e7c0-4b7b-9820-3c008dab700f · outbound

This paper cites Tavg- bench: Benchmarking text to audible-video generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Tavg- bench: Benchmarking text to audible-video generation

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.347200Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.452352Z digest=sha256:1a348b28c62435e434c0925ce0909b2afe53999dfd99b370e1eb4b0f024c34ae

Observation 1a3e5ef6-de52-4a2d-8a91-fd88d807b80d · outbound

This paper cites Foleygen: Visually-guided audio generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Foleygen: Visually-guided audio generation

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.329416Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.457875Z digest=sha256:147c1570180019c434b130d07faf34894a56f156e4b3e45db35ef8d8bc9a13cd

Observation e5b67b7a-156f-43d6-80cc-b52c39f9095a · outbound

This paper cites Snap video: Scaled spatiotemporal transformers for text-to-video synthesis.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Snap video: Scaled spatiotemporal transformers for text-to-video synthesis

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.312133Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.464141Z digest=sha256:c5cfbf30317b6493e3ff25ab961b69e721836417fc55fa53c911f000e73c0c20

Observation ee4a89d5-0dee-40fc-9b10-165b1395ad71 · outbound

This paper cites Adelson, and William T.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Adelson, and William T

Reference 64

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.294048Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.470248Z digest=sha256:44f1ebbb5af9a30c890ae48c1069f8d22bc158043d29ffc38ea4b0300f82f2a3

Observation 2628a2a9-614f-473b-81b7-8e7698f9d5db · outbound

This paper cites Masked generative video-to-audio transform- ers with enhanced synchronicity.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Masked generative video-to-audio transform- ers with enhanced synchronicity

Reference 65

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.277308Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.475796Z digest=sha256:5e6c1b87bc61defa5584df19cee4842ace30cf52b28f69b2da8c96ef15f916e4

Observation d968493c-f847-4c0d-b704-3601b99c10e2 · outbound

This paper cites Scalable diffusion mod- els with transformers.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Scalable diffusion mod- els with transformers

Reference 66

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.258618Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.481823Z digest=sha256:809874794c767b822789b05e24a79897d212e127f3336341b23ba0ba355e9401

Observation be76b20f-bdc0-4cde-a924-2e3f00be19e0 · outbound

This paper cites Film: Visual reasoning with a general conditioning layer.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Film: Visual reasoning with a general conditioning layer

Reference 67

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.239310Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.487574Z digest=sha256:074dcb970568f68ec2fc3140d591c3b8ffbff5b2361a8a539244486b65d81d13

Observation 9398dfab-a169-448d-92ea-f0287750c2da · outbound

This paper cites Sampson, Shikai Li, Si- mone Parmeggiani, Steve Fine, Tara Fowler, Vladan Petro- 11 vic, and Yuming Du.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Sampson, Shikai Li, Si- mone Parmeggiani, Steve Fine, Tara Fowler, Vladan Petro- 11 vic, and Yuming Du

Reference 68

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.221373Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.493634Z digest=sha256:20d537430c764b54bcaee53e491953e105460373502bcc8d8f8c32ad677faaae

Observation 27931671-cd45-4082-9b04-9390c66f625d · outbound

This paper cites Learn- ing transferable visual models from natural language super- vision.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Learn- ing transferable visual models from natural language super- vision

Reference 69

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.201811Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.503540Z digest=sha256:795014b56247f1f54f66d816cc1eff78fb2463d29e2bb57a8e473baf030939c2

Observation b941f193-824a-429a-920d-a8ae3afb5702 · outbound

This paper cites an unresolved cited work.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Unresolved cited work

Reference 70

Resolution
unresolved
raw_fallback, observed 2026-08-11T11:38:10.183657Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.510584Z digest=sha256:306c0adb1f935d2eea1cdd4a5bd295389e29372dcc3d36b4d8266ebbdf6c1d5c

Observation 33d81531-961a-4009-a078-e41a8cbac970 · outbound

This paper cites EgoSonics: Generating Synchronized Audio for Silent Egocentric Videos.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation EgoSonics: Generating Synchronized Audio for Silent Egocentric Videos

Reference 71

Resolution
verified exact
local_arxiv, observed 2026-08-11T11:38:09.083253Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.518540Z digest=sha256:241f8e729f354912f7d1b345021d20188101914005eff8d37a869af6ab206b88

Observation 6572317c-31b1-4bd6-847d-e69010d1a213 · outbound

This paper cites STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.524846Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.524846Z digest=sha256:93bc59c053c0bb86edc28cd85fc0eb1b05b7bf66baf642294b201c5aa4ca568c

Observation 3855bbe9-cde8-4ab7-8d19-ebf778934d1b · outbound

This paper cites Mm-diffusion: Learning multi-modal diffusion mod- els for joint audio and video generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Mm-diffusion: Learning multi-modal diffusion mod- els for joint audio and video generation

Reference 73

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.163099Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.531668Z digest=sha256:5c0f48885cc32e8ae14aa714fbf777c5c9979ff9b935df046d974d03c4395421

Observation e7452dcc-fe0c-43b7-9871-f9dded336bbd · outbound

This paper cites Improved techniques for training gans.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Improved techniques for training gans

Reference 74

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.144732Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.540913Z digest=sha256:a2336fec56f172aeb6f967613c08cd8daab2e1ce450b59532da89b57ffc11d60

Observation c31ed0eb-ce9a-4e14-91ab-119022731ec6 · outbound

This paper cites I hear your true colors: Im- age guided audio generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation I hear your true colors: Im- age guided audio generation

Reference 75

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.126600Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.548592Z digest=sha256:5c80f415a1a67ea047e5dfe0e1d6e6880817a56f50bf6502b16ea6c56e4eede9

Observation e339fad5-3435-45f4-8b7a-bfba2c375d31 · outbound

This paper cites Make-a-video: Text-to-video generation without text-video data.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Make-a-video: Text-to-video generation without text-video data

Reference 76

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.107386Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.558828Z digest=sha256:6e7428850d94976c60d13dd821994b25520505dadbea03f6774f88ca809b1385

Observation 5f42b313-b954-406b-a07b-baf800e90425 · outbound

This paper cites Roformer: Enhanced transformer with rotary position embedding.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Roformer: Enhanced transformer with rotary position embedding

Reference 77

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.089073Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.569671Z digest=sha256:be7db68c43b8f526d3260622f57ca904406aa8ecd06a43a9f8c5813d8fb3d14d

Observation 5b295371-2952-460f-a006-c9e040a762ad · outbound

This paper cites From Vision to Audio and Beyond: A Unified Model for Audio-Visual Representation and Generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation From Vision to Audio and Beyond: A Unified Model for Audio-Visual Representation and Generation

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.575530Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.575530Z digest=sha256:7acbc06b8a7122f815b4029d661a05f6ceee1dc565983c548a6d35613be6d189

Observation c42c4b43-a187-4170-9b72-4d57bcdfa1a8 · outbound

This paper cites Mm-ldm: Multi-modal latent diffusion model for sounding video generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Mm-ldm: Multi-modal latent diffusion model for sounding video generation

Reference 79

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.070770Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.582040Z digest=sha256:d9ad63d01ff2862bc131fc6b50033fa116b5cd9ce873dd43db0a6b7e20c2d639

Observation e6436e64-3cc4-4283-a367-9968b2297196 · outbound

This paper cites Motion to dance music generation using latent dif- fusion model.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Motion to dance music generation using latent dif- fusion model

Reference 80

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.051501Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.590042Z digest=sha256:4ba9538bf435d32c22b1f7054eb4a6ee586b943f778a8fe3b761f9232aa59d23

Observation 17f509ef-8cf4-48bf-be47-94fe8379f1bd · outbound

This paper cites Sequential Contrastive Audio-Visual Learning.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Sequential Contrastive Audio-Visual Learning

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.595780Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.595780Z digest=sha256:8c49bba8a3da1a804fa7aabe902527cf376a075f418b008b76a9d5ba4cc409ef

Observation d39e8293-8224-4efd-ac56-17fe3c3e9265 · outbound

This paper cites Towards Accurate Generative Models of Video: A New Metric & Challenges.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Towards Accurate Generative Models of Video: A New Metric & Challenges

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.601784Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.601784Z digest=sha256:c73df3189c4aa2df2028f3a6b57de3996a5403acc8491d868207e00bc62b07d6

Observation 17c6a2ae-05ee-4646-b9bd-c3365752c2e5 · outbound

This paper cites Temporally Aligned Audio for Video with Autoregression.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Temporally Aligned Audio for Video with Autoregression

Reference 83

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.607273Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.607273Z digest=sha256:2f9f0a2c3d28dfca5bf36ec9ab38d2410fefa0d8759292d31ad53261b9666caa

Observation 9d616061-eb7f-4e5d-8b83-f30196b59afc · outbound

This paper cites Phenaki: Variable length video generation from open do- main textual descriptions.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Phenaki: Variable length video generation from open do- main textual descriptions

Reference 84

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.034407Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.613662Z digest=sha256:44b7ecbf32557ec371fececf09fa36a000b1fe0562699b17597b5a6809292681

Observation c5402d15-6c29-4779-b6de-572cb59c2fc0 · outbound

This paper cites Audiobox: Unified Audio Generation with Natural Language Prompts.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Audiobox: Unified Audio Generation with Natural Language Prompts

Reference 85

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.619152Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.619152Z digest=sha256:f98a671a1760f3b21d55376142f5fca993354401afe49df79c05813b93b4b3e1

Observation 8cd47d0e-1072-475e-8ec1-2822c3882e28 · outbound

This paper cites V2a-mapper: A lightweight solution for vision-to-audio generation by connecting foun- dation models.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation V2a-mapper: A lightweight solution for vision-to-audio generation by connecting foun- dation models

Reference 86

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.017107Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.624308Z digest=sha256:d8d6201efc8cee1ed69f5ae515413bf1c5e95e4823f50ffd1ba0a6cc91db0aa7

Observation c64c4b3a-1444-4aef-ae97-ee09b416cf1c · outbound

This paper cites AV-DiT: Efficient Audio-Visual Diffusion Transformer for Joint Audio and Video Generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation AV-DiT: Efficient Audio-Visual Diffusion Transformer for Joint Audio and Video Generation

Reference 87

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.629162Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.629162Z digest=sha256:cbfba0acc78c13c0cb892fed489f409755aced4e50a8fcb0c08369c33675397a

Observation 1f09b0b5-3138-49b2-98a6-1bd920b09879 · outbound

This paper cites Tiva: Time-aligned video-to-audio generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Tiva: Time-aligned video-to-audio generation

Reference 88

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:09.999647Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.634755Z digest=sha256:ff3bcb82ca6b550c27bc0bc5ce965791a58b202f7a6d606e9672336765d7b5b0

Observation 0fe7c216-2d3c-46c7-baea-8628c70b65f4 · outbound

This paper cites Frieren: Efficient video-to-audio generation with rectified flow matching.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Frieren: Efficient video-to-audio generation with rectified flow matching

Reference 89

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:09.982198Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.640818Z digest=sha256:0e0638ad724bd9ec2bdf009be331907a2a831e00a16ac8138ad0da73bfdd1bec

Observation 40c0b88e-52a7-4f86-bc78-9d057a59e20b · outbound

This paper cites Large-scale con- trastive language-audio pretraining with feature fusion and keyword-to-caption augmentation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Large-scale con- trastive language-audio pretraining with feature fusion and keyword-to-caption augmentation

Reference 90

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:09.964317Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.647043Z digest=sha256:b1f2cf746e46f4b7acdc9c4a4c1da3388211e4df5976ef38eb306c2f9095c36f

Observation f8b5c5dd-6edd-467d-9a8f-f05b3403ba3d · outbound

This paper cites Son- icvisionlm: Playing sound with vision language models.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Son- icvisionlm: Playing sound with vision language models

Reference 91

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:09.946643Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.653170Z digest=sha256:9fd7f098c7112943caa458495e1d424eef85566689c55e3663751d709ab5b781

Observation 2aeb31dd-8372-4365-9f8a-27fef25138a5 · outbound

This paper cites Seeing and hearing: Open-domain visual- audio generation with diffusion latent aligners.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Seeing and hearing: Open-domain visual- audio generation with diffusion latent aligners

Reference 92

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:09.928177Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.659002Z digest=sha256:8fccd216cd44dbc50abab86103280c77f9912275e5e9947abe31e935f6557181

Observation 9ba67d64-8a39-4605-988a-adb3d59d14a2 · outbound

This paper cites Demystifying CLIP Data.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Demystifying CLIP Data

Reference 93

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.665706Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.665706Z digest=sha256:c75a0fb826663621ec35aa6dd355787cb6f27651ad44f5a51456b40e9de40d1b

Observation 783d744a-e4aa-40e3-9e06-2d623bf2308c · outbound

This paper cites Open-vocabulary panop- tic segmentation with text-to-image diffusion models.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Open-vocabulary panop- tic segmentation with text-to-image diffusion models

Reference 94

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:09.909152Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.671346Z digest=sha256:75d184362e7fc0d8bef793f6fa772bc0da43594731549db0cf9b0f4fb14d58f7

Observation be5f2385-ce48-4bff-a520-1b547a610d1d · outbound

This paper cites Auf- fusion: Leveraging the power of diffusion and large lan- guage models for text-to-audio generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Auf- fusion: Leveraging the power of diffusion and large lan- guage models for text-to-audio generation

Reference 95

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:09.890544Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.676975Z digest=sha256:a11f35e926dde8d03c792420ce3c8f37657ce86c3e3f178c3a72a73bc307cd82

Observation e8c34cb8-e5e7-49d9-b3fb-412f0dd77e56 · outbound

This paper cites Draw an Audio: Leveraging Multi-Instruction for Video-to-Audio Synthesis.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Draw an Audio: Leveraging Multi-Instruction for Video-to-Audio Synthesis

Reference 96

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.683531Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.683531Z digest=sha256:150bdbd1bc7fd28e12a6dd60fd3ef8177ea1bdfbdbce02bdd49a45065eee53fc

Observation 9f0a9c24-7b86-49fb-b758-a0fa974a616a · outbound

This paper cites CMMD: Contrastive Multi-Modal Diffusion for Video-Audio Conditional Modeling.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation CMMD: Contrastive Multi-Modal Diffusion for Video-Audio Conditional Modeling

Reference 97

Resolution
verified exact
local_arxiv, observed 2026-08-11T11:38:08.883104Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.689777Z digest=sha256:1ff1bfe27e55d4d003b21bf1a7b91c427b10684e6a99277077a8c2207ab90bfd

Observation a9d01660-7b03-48bc-982f-d3b2aa92b682 · outbound

This paper cites Diffusion model as rep- resentation learner.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Diffusion model as rep- resentation learner

Reference 98

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:09.870310Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.695444Z digest=sha256:1fd522cefa0556b5c17cec714723f666bdfed57f5c5c7aaa59e408d1b6311906

Observation 90778f86-5f84-465a-b49b-884719eee09f · outbound

This paper cites CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer

Reference 99

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.701528Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.701528Z digest=sha256:b12f1e0bd36d687fa9d0d982dc9b39c3779000a36645e2662a2541c906b401ec

Observation 2d3b3dbf-0b50-495d-8127-ac13507d7c48 · outbound

This paper cites Diverse and aligned audio-to- video generation via text-to-video model adaptation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Diverse and aligned audio-to- video generation via text-to-video model adaptation

Reference 100

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:09.852365Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.708100Z digest=sha256:610b042293052266a1eb28a7891b66488b9103cc0e474c5d0e1a514908e9bac8

Observation 59f13910-172e-40cf-b89e-3d0a29552419 · outbound

This paper cites Momu-diffusion: On learning long-term motion-music synchronization and cor- respondence.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Momu-diffusion: On learning long-term motion-music synchronization and cor- respondence

Reference 101

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:09.835231Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.713130Z digest=sha256:cd804760d86b606a59253f62183390c66a40e632d378d4843e9bf92f91a1cf77

Pith citing papers

Observation 16755c82-6b7f-4480-9a83-682402e864d4 · inbound

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing cites this paper.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:56.032167Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:56.032167Z digest=sha256:9bdb866a309eaa7699b97b7aaa9d9908bc77672da330e850a1e791a03efbf58a