Pith. sign in

Paper Citation Record · LEDGER

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation

As of 12 August 2026, this Paper Citation Record lists 100 of 105 outbound references and 1 inbound Pith citation observation for arXiv:2412.15191.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2412.15191 v2

Coverage vector

measured 100 of 105 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-11T11:38:08.713130Z

measured 101 of 101 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-12T06:34:41.77262+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-03T16:25:56.032167Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

100 of 105 outbound references displayed

  • verified exact3
  • verified fuzzy39
  • unresolved58
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation d296dfca-7f78-4ed4-ad45-9d27d9470b9d · outbound

This paper cites Vid- styleode: Disentangled video editing via stylegan and neu- ralodes.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Vid- styleode: Disentangled video editing via stylegan and neu- ralodes

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.104515Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.104515Z digest=sha256:d21f49e9d22b8c1bbe1b20c436fec45c23d275de1a43760624835fd0f3e7ad67

Observation d9359a8d-e7c7-4f8d-ab45-c9513933f26d · outbound

This paper cites Label-Efficient Semantic Segmentation with Diffusion Models.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Label-Efficient Semantic Segmentation with Diffusion Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.110731Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.110731Z digest=sha256:1e7e3b90c36beffdf85ca6e1f7d26aa328d004ee9f106ae1b4d0279a0d689684

Observation d83f8c8f-4a5a-4581-83f9-9467f2cdbec1 · outbound

This paper cites SonicDiffusion: Audio-Driven Image Generation and Editing with Pretrained Diffusion Models.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation SonicDiffusion: Audio-Driven Image Generation and Editing with Pretrained Diffusion Models

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.116734Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.116734Z digest=sha256:c0d6ce2ff576550fdeae5dae546a4551bfb1ecbb395d5782b623cddabdd333b1

Observation 5d15ec61-52dc-4fb9-9dc3-41e1931aa447 · outbound

This paper cites Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.122293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.122293Z digest=sha256:8a9e4a63d3b9b9fc77ce491e967f9f407b93e54c30644a7a8fbe36284edd4852

Observation c14217bb-83e5-40f8-8dfb-f277c4c48743 · outbound

This paper cites Align your latents: High-resolution video synthesis with latent diffusion models.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Align your latents: High-resolution video synthesis with latent diffusion models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.128519Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.128519Z digest=sha256:0e227c15c565f11031ec3d697c929fceedaa0d1de3adca38e8cc3a4c12726412

Observation 190444a4-fb82-4e21-a2f1-f5700c7d9b94 · outbound

This paper cites The mtg-jamendo dataset for au- tomatic music tagging.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation The mtg-jamendo dataset for au- tomatic music tagging

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.134204Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.134204Z digest=sha256:4059486c0627a9a94e4cf1d1d1cbd00983f38a0627a42e3fc63cbc8a002a4b14

Observation c7e5e277-678d-407e-9756-72b5901cfd16 · outbound

This paper cites Video generation models as world simulators.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Video generation models as world simulators

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.140769Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.140769Z digest=sha256:a8e30f254bf979dcb36cbc9b3a2340e8b6205c95c6c0f29b1e9137fa4f773989

Observation c65a41bc-86c4-4fb1-8037-5e0af3aaae0e · outbound

This paper cites Ac- tion2sound: Ambient-aware generation of action sounds from egocentric videos.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Ac- tion2sound: Ambient-aware generation of action sounds from egocentric videos

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.146634Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.146634Z digest=sha256:93d5ccfd08cea66bd9091410586032cf1d10f9e8f9c3eb24469e2cbe6e1bbc9b

Observation 7ebe36cc-7eac-4a74-8eff-e592fb698c62 · outbound

This paper cites Semantically consistent video-to-audio generation using multimodal language large model, 2024.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Semantically consistent video-to-audio generation using multimodal language large model, 2024

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.153035Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.153035Z digest=sha256:48d448a38915a35facd1c5bdfebbfeb1d3fcb2079498283ff976b3dce4b2d78a

Observation 53c66c15-5a4e-4dfa-a5b5-8d8d33eadb2e · outbound

This paper cites Vggsound: A large-scale audio-visual dataset.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Vggsound: A large-scale audio-visual dataset

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.159115Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.159115Z digest=sha256:1004b2b266b83f3c1c5cec6b5f0e0052c89bc68f1186690657a19caa1fd96fc7

Observation 8835410d-eec2-4e66-ad2a-9bdad8343a2e · outbound

This paper cites Beats: audio pre-training with acoustic tokeniz- ers.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Beats: audio pre-training with acoustic tokeniz- ers

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.164804Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.164804Z digest=sha256:abec77f73f19644dd4c3861689453e7bda1984f451a9894a3981a7643da14823

Observation c2bbfb5e-8eed-417f-803c-5a30e08840e1 · outbound

This paper cites Panda-70m: Captioning 70m videos with multiple cross-modality teachers.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Panda-70m: Captioning 70m videos with multiple cross-modality teachers

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.170524Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.170524Z digest=sha256:d928fabd797a37d2fbf9c6f8b8bbbde5147257427d1cdae364104d026a16af92

Observation fa0388dc-d1d6-4625-bbb7-c2d912a3ecc3 · outbound

This paper cites Unrav- eling instance associations: A closer look for audio-visual segmentation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Unrav- eling instance associations: A closer look for audio-visual segmentation

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.175962Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.175962Z digest=sha256:2954ad57c4fa02b08020e60ad2e841140b4bf9599dbda75e7535d958118b597f

Observation 0bf5ea14-9876-48ba-a115-d84c7c909ef7 · outbound

This paper cites Video-Guided Foley Sound Generation with Multimodal Controls.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Video-Guided Foley Sound Generation with Multimodal Controls

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.186627Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.186627Z digest=sha256:dca17446aa9c3824ac494b1469f8b78292a0e2aa3eaec91ebf01d8e1ca46a8ba

Observation 38893e5b-74f9-4975-874b-f70ba02afcbf · outbound

This paper cites MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.191695Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.191695Z digest=sha256:3cc6acf1ae55bbe9db6cbcda95bb837f4018e8ca5b1d7bfbc71297ca53cc57b7

Observation 87acbeb6-f1d4-46a6-8775-7cafb0fc1144 · outbound

This paper cites LoVA: Long-form Video-to-Audio Generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation LoVA: Long-form Video-to-Audio Generation

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.197220Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.197220Z digest=sha256:9223e92b1ece8ed3e6c3613268864a523c565e923ba1ad6670391a5c6eb92950

Observation 4da5ae48-9c18-40cb-82d2-614b52eedfef · outbound

This paper cites Visionllama: A unified llama backbone for vision tasks.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Visionllama: A unified llama backbone for vision tasks

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.203510Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.203510Z digest=sha256:0b2cb44964bd93f081be87c041fcef835f02310c41e24abefc2495991fe0affd

Observation c916368b-5b23-488c-a859-6da8e0700625 · outbound

This paper cites FMA: A dataset for music analysis.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation FMA: A dataset for music analysis

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.208913Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.208913Z digest=sha256:042269fecad0ca961a135aad4b35e632ea5ce48655314682be6a6d06964308f2

Observation 86aac1ef-94e9-4e15-85ee-20240d518095 · outbound

This paper cites Conditional generation of audio from 9 video via foley analogies.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Conditional generation of audio from 9 video via foley analogies

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.214386Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.214386Z digest=sha256:9d33f8c5c52d69e7b8dc65b7ca54ba4828141be83e7732fe4b360c1873dc114a

Observation b9f203f6-1502-4a60-bcf1-3cf0536f07b2 · outbound

This paper cites Clap learning audio concepts from natural language supervision.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Clap learning audio concepts from natural language supervision

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.219790Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.219790Z digest=sha256:039a7314eb4936d1543e58b93e616d166d7060eb30844527f1d821aa363e5a4d

Observation 58dad096-f52e-43dd-b2a4-f5763cc6b66d · outbound

This paper cites Scaling recti- fied flow transformers for high-resolution image synthesis.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Scaling recti- fied flow transformers for high-resolution image synthesis

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.225668Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.225668Z digest=sha256:bd140cdd7a04f4b2257c1fbc4ef44d13fb558fd566d7b59a58ece636938efa3f

Observation 27cada57-4874-4724-b88c-288452bc6502 · outbound

This paper cites Hawley, and Jordi Pons.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Hawley, and Jordi Pons

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.231204Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.231204Z digest=sha256:65bf3f03f5437ff660cfb912952057176a2323f9fe50bee37693912352c699e2

Observation c3df8024-a0d7-430d-b42f-f96de7d39de6 · outbound

This paper cites Gemmeke, Daniel P.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Gemmeke, Daniel P

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.236538Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.236538Z digest=sha256:a07fd4fa0da3c9d1111592ca311f2e1b45e1de7f4131651470f11d7ec4705e69

Observation 345df0a7-7b26-43f5-9dd4-d4e26beb1806 · outbound

This paper cites Imagebind: One embedding space to bind them all.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Imagebind: One embedding space to bind them all

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.241917Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.241917Z digest=sha256:3df21744f1395d7bcf20f03fe977f80b97f7b9759d1356b1c9810ddde61aec66

Observation b9f57ae0-859d-4f53-97c0-5ea1ff617699 · outbound

This paper cites Gotta Hear Them All: Towards Sound Source Aware Audio Generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Gotta Hear Them All: Towards Sound Source Aware Audio Generation

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.247422Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.247422Z digest=sha256:6a471782de507576929c9ac0e88f23a1a0ff0973a511b23224660d5dc3d30268

Observation 1077e4aa-094b-498e-829b-60aa55850084 · outbound

This paper cites Taming Data and Transformers for Audio Generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Taming Data and Transformers for Audio Generation

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.253139Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.253139Z digest=sha256:3bba881335c068fb1d5ba749371a3f7c2da5b1fc98c2ca447e7ead9b7129e17f

Observation 0d3c1d2f-5b50-40de-90c7-60d7aa395fea · outbound

This paper cites MMDisCo: Multi-Modal Discriminator-Guided Cooperative Diffusion for Joint Audio and Video Generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation MMDisCo: Multi-Modal Discriminator-Guided Cooperative Diffusion for Joint Audio and Video Generation

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.258353Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.258353Z digest=sha256:0510aa1ff75cb77b9800a0f0d22527c883db75b0e9e1d924da387d20d1d71627

Observation ffdbda98-bd85-47f2-bea0-ddef94a55ac9 · outbound

This paper cites Unsupervised semantic correspondence using stable diffusion, 2023.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Unsupervised semantic correspondence using stable diffusion, 2023

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.264064Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.264064Z digest=sha256:4f3a3934038bff151a71239e17840707d660f67ea51a934b214284378b82ebc6

Observation be0f8032-d1fe-4f88-9550-82f8162ab192 · outbound

This paper cites Gans trained by a two time-scale update rule converge to a local nash equi- librium.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Gans trained by a two time-scale update rule converge to a local nash equi- librium

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.269526Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.269526Z digest=sha256:1101725ec666fde6e924f916cdedee9a106d65b448cf1f876fa96163a180880c

Observation 1a14cfa0-667a-48ea-b424-a126158d8588 · outbound

This paper cites Classifier-free diffusion guidance.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Classifier-free diffusion guidance

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.274591Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.274591Z digest=sha256:24a27a237889eba371f79e48c850406d4bc75607b1395d4bfc099f02cd8989dd

Observation d4a0bd31-d441-421b-984a-14c116f6da46 · outbound

This paper cites Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.280118Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.280118Z digest=sha256:802cbe0646b2fd1f66b6f1c9ecc1fbb43dd7e7b1ceee356b6b098fe9c514672f

Observation 1ccb6364-d46c-4181-a344-f7ef90054b3e · outbound

This paper cites Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.285520Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.285520Z digest=sha256:3fb6c47db23beb18232122620e751514e35c460876f7c07110c6e5464a8f0ba5

Observation fe63b53a-86be-461c-b420-be6531c6fe01 · outbound

This paper cites Epic-sounds: A large- scale dataset of actions that sound.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Epic-sounds: A large- scale dataset of actions that sound

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.291415Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.291415Z digest=sha256:963c3941a2b4f7b31be925fcafba76cdecce0c1a668939305a3cef23b1d2066c

Observation 7c33fc9b-ae33-4f4f-ab48-15a4240349d6 · outbound

This paper cites Taming visually guided sound generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Taming visually guided sound generation

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.297020Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.297020Z digest=sha256:60b9a57f57656cd9314c11652396b0dee809b2ee7051f961eed8f8126db5fefb

Observation 3f26d0e5-5a5e-488e-8b79-6cf965eb5261 · outbound

This paper cites A Simple but Strong Baseline for Sounding Video Generation: Effective Adaptation of Audio and Video Diffusion Models for Joint Generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation A Simple but Strong Baseline for Sounding Video Generation: Effective Adaptation of Audio and Video Diffusion Models for Joint Generation

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.302374Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.302374Z digest=sha256:e0f0465c4deafd8afefce48090a220559563e48a6d1e82a0269601b1195bb41e

Observation 0c023b92-9c29-49ac-8357-c674e1a97113 · outbound

This paper cites The power of sound (tpos): Audio reactive video generation with stable diffusion.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation The power of sound (tpos): Audio reactive video generation with stable diffusion

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.308086Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.308086Z digest=sha256:9b0e9b03f2211d36cf2679892b31eeeafe12903ce56e465a7c5b29227fc2b271

Observation fdb49b99-ba46-41c2-b18e-c2843704a41d · outbound

This paper cites Pyramidal flow matching for efficient video generative modeling.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Pyramidal flow matching for efficient video generative modeling

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.313681Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.313681Z digest=sha256:15eb53ab9301ee2f26f05b512b6961953bc7b40e60959f4186472d27c0697ec3

Observation 81065381-d8b1-453a-acf5-eb516161f96e · outbound

This paper cites Re- purposing diffusion-based image generators for monocular depth estimation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Re- purposing diffusion-based image generators for monocular depth estimation

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.320944Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.320944Z digest=sha256:3c67b87224ff6ded0c5b9a61b48edd02b4aa51be3a9ca25b8e398ecec710879a

Observation eb732a7a-d8e7-4279-98ef-4b1b9af7299d · outbound

This paper cites A Versatile Diffusion Transformer with Mixture of Noise Levels for Audiovisual Generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation A Versatile Diffusion Transformer with Mixture of Noise Levels for Audiovisual Generation

Reference 40

Resolution
verified exact
local_arxiv, observed 2026-08-11T11:38:09.436342Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.327784Z digest=sha256:3e0d7183fd7e25b777a116c43a69b8903d2357ba0edba2bd9b239d6a9678d8f6

Observation aee831d3-0c03-4500-8a2b-4639b39f53d8 · outbound

This paper cites Hifi-gan: Generative adversarial networks for efficient and high fi- delity speech synthesis.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Hifi-gan: Generative adversarial networks for efficient and high fi- delity speech synthesis

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.543955Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.333818Z digest=sha256:6817f1f3fa114ef463993f80c4e34d06a4a229c36dce78fa664483e6d27fabab

Observation 52d52cb8-48a5-4be9-989e-07211047f4bf · outbound

This paper cites VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.339998Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.339998Z digest=sha256:cc67ec4ee6c226862eb5dcce3ae161ac6f0667a98f5811e3a71b5c73a1f0bab7

Observation 1da30b39-53eb-4a0e-b4a0-803257faffb9 · outbound

This paper cites Mandel, Mert Bay, and J.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Mandel, Mert Bay, and J

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.525705Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.345676Z digest=sha256:d0f733c07c3f0d1b5891a52b3cda19aaa59349dfe8aa0c93964744789fac6e15

Observation a492f3c0-dc1a-4e96-b4ae-85b486274e10 · outbound

This paper cites Video-foley: Two-stage video-to-sound generation via tem- poral event condition for foley sound.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Video-foley: Two-stage video-to-sound generation via tem- poral event condition for foley sound

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.350927Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.350927Z digest=sha256:97ef3e80be7efc40dd84683c42ae135a1882362921c8d81375406ec13f05fa3b

Observation 08fb4f88-1400-45e6-9001-162a68cd3ee4 · outbound

This paper cites AADiff: Audio-Aligned Video Synthesis with Text-to-Image Diffusion.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation AADiff: Audio-Aligned Video Synthesis with Text-to-Image Diffusion

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.356490Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.356490Z digest=sha256:4e759bb438bd76ca902cf3ffe6a5087d8026942ba2bbb9651878b2fe5fb04c6c

Observation 3f2d74c1-4fc9-4855-a314-b5d48a2cad39 · outbound

This paper cites Sound-guided semantic video generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Sound-guided semantic video generation

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.508429Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.362619Z digest=sha256:ad5b5ad2ab3a5d443b870aa3e5b30648ea3e75f512b51ace69162908516d48ea

Observation cc3d2874-6914-43b0-8606-63c48b05cbaa · outbound

This paper cites T2v-turbo-v2: Enhancing video generation model post- training through data, reward, and conditional guidance de- sign.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation T2v-turbo-v2: Enhancing video generation model post- training through data, reward, and conditional guidance de- sign

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.368474Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.368474Z digest=sha256:7e3b8954678493df99271987815e657e31cb8efb67f76c75495717932e207882

Observation 8665cc07-3bd3-474d-a636-d1a4e135c064 · outbound

This paper cites Ross, and Angjoo Kanazawa.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Ross, and Angjoo Kanazawa

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.490694Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.373866Z digest=sha256:aa0f6edaf15f74fa242dce6bd62b42f517d3dfaf67af2d7f07924822e8ca7d76

Observation ccc2f29f-7925-4ba2-853c-5c31c45ebc5a · outbound

This paper cites MuVi: Video-to-Music Generation with Semantic Alignment and Rhythmic Synchronization.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation MuVi: Video-to-Music Generation with Semantic Alignment and Rhythmic Synchronization

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.379292Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.379292Z digest=sha256:e49bbaba9a6a001f46f5699ed9bd5c5e8b037df1171bd7c3850a115a59299a83

Observation d6f3e263-0aaf-4035-863e-03ade21e1c34 · outbound

This paper cites Language-guided joint audio-visual editing via one-shot adaptation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Language-guided joint audio-visual editing via one-shot adaptation

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.473442Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.385173Z digest=sha256:91de0f1ee672b46ba9770840dd559d58b72f5bed5bcf10b2a2b2620a724ae03d

Observation 5508d397-fdaa-414c-baa7-b7cd7b5b4e4f · outbound

This paper cites VMAS: Video-to-Music Generation via Semantic Alignment in Web Music Videos.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation VMAS: Video-to-Music Generation via Semantic Alignment in Web Music Videos

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.390974Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.390974Z digest=sha256:7b023055466905b92d2d4ebe1766c7c213994e48be52772a81de39a826a64ba8

Observation 81ff63fc-d68d-44a5-83c0-2d634979c4c9 · outbound

This paper cites Flow Matching for Generative Modeling.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Flow Matching for Generative Modeling

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.396773Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.396773Z digest=sha256:6d4c6d0e00a8f5c16e1a329169acbae00af1e6a01c1b3a85621a4210ebf9d758

Observation db5a51b4-dbb8-45b3-8626-b30f21889909 · outbound

This paper cites Plumbley.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Plumbley

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.454690Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.402890Z digest=sha256:eb07d6d2d9f367954cfe858c920958c224c1569d7bf0cb6a8d6ec2e83e9da570

Observation 836db613-10af-4d07-8f33-c24fcf3f0009 · outbound

This paper cites AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.409162Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.409162Z digest=sha256:593a3358a87a7234e4386042123c38d6774a871ce639ee5fc7c4e168d442f94e

Observation 5d26fc6e-5f18-41e0-a3c4-a39b3e6bfd48 · outbound

This paper cites Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.415238Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.415238Z digest=sha256:adc89dec9246d856470a889a823691c37d50a976cb2a7a9a2eb628427ac719ee

Observation 91f568f4-b8df-452d-91e9-eccbf1446a63 · outbound

This paper cites Diffusion hyperfeatures: Searching through time and space for semantic correspon- dence.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Diffusion hyperfeatures: Searching through time and space for semantic correspon- dence

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.437844Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.421089Z digest=sha256:7c0a2bf996aa3633aaf97bc0941cb9edb4edfcc2dbcca28854bba8d9ac4f7f12

Observation ce2c0459-1686-4549-b415-966e4ad8bdab · outbound

This paper cites Diff-foley: Synchronized video-to-audio synthesis with la- tent diffusion models.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Diff-foley: Synchronized video-to-audio synthesis with la- tent diffusion models

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.419482Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.426561Z digest=sha256:f8ceea13e0c67b73a3d00ebae94c493f22e305f41c86200fed10915ef3b1085f

Observation 4b19e8e2-9ce0-423b-a4dd-e5f6488c3d19 · outbound

This paper cites Videofusion: Decomposed diffusion models for high-quality video generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Videofusion: Decomposed diffusion models for high-quality video generation

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.400805Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.433111Z digest=sha256:a23996ce69efdf684911ca8882a1b2eaf646c9983752ed931ce3f0bf744f662f

Observation ff0f5ce3-fe6e-47e0-821d-f298dac1f104 · outbound

This paper cites Tango 2: Aligning diffusion-based text-to-audio genera- tions through direct preference optimization.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Tango 2: Aligning diffusion-based text-to-audio genera- tions through direct preference optimization

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.383183Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.439491Z digest=sha256:b9a87eb572d5461870524b4797890aa4dd6dd76e770d21b317684632d462cf94

Observation bd0a535c-367d-49a1-ac21-060fd96d3ee0 · outbound

This paper cites The song describer dataset: a corpus of audio captions for music-and-language evaluation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation The song describer dataset: a corpus of audio captions for music-and-language evaluation

Reference 60

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.365419Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.446429Z digest=sha256:868dba0cef71a631b926d62c2295852aa0aa86ee9fc0046000f5fd4474e6be43

Observation 7f424f3d-e7c0-4b7b-9820-3c008dab700f · outbound

This paper cites Tavg- bench: Benchmarking text to audible-video generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Tavg- bench: Benchmarking text to audible-video generation

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.347200Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.452352Z digest=sha256:f04967a55699343594c6d094f385ed4f0140377495cce08d2b321544543df2d9

Observation 1a3e5ef6-de52-4a2d-8a91-fd88d807b80d · outbound

This paper cites Foleygen: Visually-guided audio generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Foleygen: Visually-guided audio generation

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.329416Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.457875Z digest=sha256:10d045ef6f4eba2f8ded9479fa91dd3aec0d7b8dc57aa41521a42015d4701259

Observation e5b67b7a-156f-43d6-80cc-b52c39f9095a · outbound

This paper cites Snap video: Scaled spatiotemporal transformers for text-to-video synthesis.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Snap video: Scaled spatiotemporal transformers for text-to-video synthesis

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.312133Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.464141Z digest=sha256:d953d4010f4b02a9ef13a3993b66e8f92f757fb23345b4b8aaa000b0b02495ec

Observation ee4a89d5-0dee-40fc-9b10-165b1395ad71 · outbound

This paper cites Adelson, and William T.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Adelson, and William T

Reference 64

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.294048Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.470248Z digest=sha256:c37d34d6812647436497747f64e1b1bf3a8d6cab9992d80d48039877b75b4258

Observation 2628a2a9-614f-473b-81b7-8e7698f9d5db · outbound

This paper cites Masked generative video-to-audio transform- ers with enhanced synchronicity.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Masked generative video-to-audio transform- ers with enhanced synchronicity

Reference 65

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.277308Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.475796Z digest=sha256:09e4d4eda91b0ded065d7a94c74c97015376099ac8530b6c9121401e91dc7279

Observation d968493c-f847-4c0d-b704-3601b99c10e2 · outbound

This paper cites Scalable diffusion mod- els with transformers.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Scalable diffusion mod- els with transformers

Reference 66

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.258618Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.481823Z digest=sha256:e90468d8bdea44b7aaf935eee74a4eafa22d1a58dee87984c71c30f94d06adc9

Observation be76b20f-bdc0-4cde-a924-2e3f00be19e0 · outbound

This paper cites Film: Visual reasoning with a general conditioning layer.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Film: Visual reasoning with a general conditioning layer

Reference 67

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.239310Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.487574Z digest=sha256:491849bf3116d9ad7e22d535ca082997148c62a95ac6d0618f96f0bf1b2c0deb

Observation 9398dfab-a169-448d-92ea-f0287750c2da · outbound

This paper cites Sampson, Shikai Li, Si- mone Parmeggiani, Steve Fine, Tara Fowler, Vladan Petro- 11 vic, and Yuming Du.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Sampson, Shikai Li, Si- mone Parmeggiani, Steve Fine, Tara Fowler, Vladan Petro- 11 vic, and Yuming Du

Reference 68

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.221373Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.493634Z digest=sha256:95ed36548283e906103bebf098612607108e033a75ca8b7518f1abaf8159b1cd

Observation 27931671-cd45-4082-9b04-9390c66f625d · outbound

This paper cites Learn- ing transferable visual models from natural language super- vision.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Learn- ing transferable visual models from natural language super- vision

Reference 69

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.201811Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.503540Z digest=sha256:04ea616fcf46b8cf4c5e713433e0ac643408bfdbc66d80a50737e399ff212d63

Observation b941f193-824a-429a-920d-a8ae3afb5702 · outbound

This paper cites an unresolved cited work.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Unresolved cited work

Reference 70

Resolution
unresolved
raw_fallback, observed 2026-08-11T11:38:10.183657Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.510584Z digest=sha256:63976de325cf96986a68138c540176eb7bbe4e1189542594a7ab16349d3564df

Observation 33d81531-961a-4009-a078-e41a8cbac970 · outbound

This paper cites EgoSonics: Generating Synchronized Audio for Silent Egocentric Videos.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation EgoSonics: Generating Synchronized Audio for Silent Egocentric Videos

Reference 71

Resolution
verified exact
local_arxiv, observed 2026-08-11T11:38:09.083253Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.518540Z digest=sha256:ab2d51cfdbe011823018b4ea37d8caf553ee185f41010147b5a8f39e81a44021

Observation 6572317c-31b1-4bd6-847d-e69010d1a213 · outbound

This paper cites STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.524846Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.524846Z digest=sha256:0aaa0a5499ba3833abc72a1d42756e827de0b6c7cbecba8421c26dae2e41171a

Observation 3855bbe9-cde8-4ab7-8d19-ebf778934d1b · outbound

This paper cites Mm-diffusion: Learning multi-modal diffusion mod- els for joint audio and video generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Mm-diffusion: Learning multi-modal diffusion mod- els for joint audio and video generation

Reference 73

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.163099Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.531668Z digest=sha256:3a18f99ae04b2ca4e89218d9f93b53581cb34377dfa43577fce415897f5745e9

Observation e7452dcc-fe0c-43b7-9871-f9dded336bbd · outbound

This paper cites Improved techniques for training gans.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Improved techniques for training gans

Reference 74

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.144732Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.540913Z digest=sha256:df955ae9a2747d7330209fcd508d989cf025e28e3a644f6f440dfa0af89a6ab2

Observation c31ed0eb-ce9a-4e14-91ab-119022731ec6 · outbound

This paper cites I hear your true colors: Im- age guided audio generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation I hear your true colors: Im- age guided audio generation

Reference 75

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.126600Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.548592Z digest=sha256:6d7a263aee567488b56c0b9ce8b642a84d2b7b10bfb9f3b24a841fbf5c3a54b9

Observation e339fad5-3435-45f4-8b7a-bfba2c375d31 · outbound

This paper cites Make-a-video: Text-to-video generation without text-video data.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Make-a-video: Text-to-video generation without text-video data

Reference 76

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.107386Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.558828Z digest=sha256:32156036bca21760406914fac1b286fd7f09d0c51c0bbb8376c2d25761fe8db7

Observation 5f42b313-b954-406b-a07b-baf800e90425 · outbound

This paper cites Roformer: Enhanced transformer with rotary position embedding.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Roformer: Enhanced transformer with rotary position embedding

Reference 77

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.089073Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.569671Z digest=sha256:8bc9326f8f615bf8153b4159e946792528adad98be124cae69c7173933538d06

Observation 5b295371-2952-460f-a006-c9e040a762ad · outbound

This paper cites From Vision to Audio and Beyond: A Unified Model for Audio-Visual Representation and Generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation From Vision to Audio and Beyond: A Unified Model for Audio-Visual Representation and Generation

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.575530Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.575530Z digest=sha256:a186ecd03a15a632242b4d34e01812dcf6e1d3fa8ca72a6820cd97c58fff6f6c

Observation c42c4b43-a187-4170-9b72-4d57bcdfa1a8 · outbound

This paper cites Mm-ldm: Multi-modal latent diffusion model for sounding video generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Mm-ldm: Multi-modal latent diffusion model for sounding video generation

Reference 79

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.070770Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.582040Z digest=sha256:bddf22d845dd4ab17db0f083623b47662f43b4f72a0a3d18c749f22606d33669

Observation e6436e64-3cc4-4283-a367-9968b2297196 · outbound

This paper cites Motion to dance music generation using latent dif- fusion model.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Motion to dance music generation using latent dif- fusion model

Reference 80

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.051501Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.590042Z digest=sha256:6da9bb9d302dd45117b5176281f0f860b7f57a489eb75b5f9f7e15429b46a497

Observation 17f509ef-8cf4-48bf-be47-94fe8379f1bd · outbound

This paper cites Sequential Contrastive Audio-Visual Learning.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Sequential Contrastive Audio-Visual Learning

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.595780Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.595780Z digest=sha256:63a3ccbdb82e542efa61c109b0d653b0574fd0934cb0be0bafe03cc582094bb6

Observation d39e8293-8224-4efd-ac56-17fe3c3e9265 · outbound

This paper cites Towards Accurate Generative Models of Video: A New Metric & Challenges.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Towards Accurate Generative Models of Video: A New Metric & Challenges

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.601784Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.601784Z digest=sha256:b645e004b58ffdf88702c1ba555dc9b53b08a9d9b3ddbc47c1c0fe30bd33acf4

Observation 17c6a2ae-05ee-4646-b9bd-c3365752c2e5 · outbound

This paper cites Temporally Aligned Audio for Video with Autoregression.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Temporally Aligned Audio for Video with Autoregression

Reference 83

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.607273Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.607273Z digest=sha256:b5772d45a21ef62de09c4d77695cba2de89642a11dcfaba1c841321cb19d7fdb

Observation 9d616061-eb7f-4e5d-8b83-f30196b59afc · outbound

This paper cites Phenaki: Variable length video generation from open do- main textual descriptions.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Phenaki: Variable length video generation from open do- main textual descriptions

Reference 84

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.034407Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.613662Z digest=sha256:cb8f2d903db70dc181a8f609d1e9825a77c592680660f6b71b0faefa9d6f4178

Observation c5402d15-6c29-4779-b6de-572cb59c2fc0 · outbound

This paper cites Audiobox: Unified Audio Generation with Natural Language Prompts.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Audiobox: Unified Audio Generation with Natural Language Prompts

Reference 85

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.619152Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.619152Z digest=sha256:10ef9a0189b55e9640ab5d421c3f905c1af148b93cb55e92812beb9561f342c2

Observation 8cd47d0e-1072-475e-8ec1-2822c3882e28 · outbound

This paper cites V2a-mapper: A lightweight solution for vision-to-audio generation by connecting foun- dation models.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation V2a-mapper: A lightweight solution for vision-to-audio generation by connecting foun- dation models

Reference 86

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:10.017107Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.624308Z digest=sha256:0021b61dabc1f9befe4342882ee565b952adef020622a0be162fde09a76d7545

Observation c64c4b3a-1444-4aef-ae97-ee09b416cf1c · outbound

This paper cites AV-DiT: Efficient Audio-Visual Diffusion Transformer for Joint Audio and Video Generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation AV-DiT: Efficient Audio-Visual Diffusion Transformer for Joint Audio and Video Generation

Reference 87

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.629162Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.629162Z digest=sha256:464b3eb488779039b89e700326922ab115751b1bbf00b06e7905374b931604e6

Observation 1f09b0b5-3138-49b2-98a6-1bd920b09879 · outbound

This paper cites Tiva: Time-aligned video-to-audio generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Tiva: Time-aligned video-to-audio generation

Reference 88

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:09.999647Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.634755Z digest=sha256:4ab40b56967d5f4706a27f4a709a7133160db3359957e793c1ef9093e7d7ad8f

Observation 0fe7c216-2d3c-46c7-baea-8628c70b65f4 · outbound

This paper cites Frieren: Efficient video-to-audio generation with rectified flow matching.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Frieren: Efficient video-to-audio generation with rectified flow matching

Reference 89

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:09.982198Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.640818Z digest=sha256:e996d10bf27d21f24acfb37ee468d2865f63ad70e01d88c9ad9fded9d4268e19

Observation 40c0b88e-52a7-4f86-bc78-9d057a59e20b · outbound

This paper cites Large-scale con- trastive language-audio pretraining with feature fusion and keyword-to-caption augmentation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Large-scale con- trastive language-audio pretraining with feature fusion and keyword-to-caption augmentation

Reference 90

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:09.964317Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.647043Z digest=sha256:46871055d0d28726b2c9d5b3159b02d38bf0d607f71d52509e08a515d82c5a9a

Observation f8b5c5dd-6edd-467d-9a8f-f05b3403ba3d · outbound

This paper cites Son- icvisionlm: Playing sound with vision language models.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Son- icvisionlm: Playing sound with vision language models

Reference 91

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:09.946643Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.653170Z digest=sha256:db9fbe0576801314e3e29303a7513646b7ca396fa64a231c9955c397d61c7648

Observation 2aeb31dd-8372-4365-9f8a-27fef25138a5 · outbound

This paper cites Seeing and hearing: Open-domain visual- audio generation with diffusion latent aligners.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Seeing and hearing: Open-domain visual- audio generation with diffusion latent aligners

Reference 92

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:09.928177Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.659002Z digest=sha256:6a0e69311aff2d70d24663497011e339745b0a8f442c89ab8906a4258c46e02a

Observation 9ba67d64-8a39-4605-988a-adb3d59d14a2 · outbound

This paper cites Demystifying CLIP Data.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Demystifying CLIP Data

Reference 93

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.665706Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.665706Z digest=sha256:e889514c12f83749bf4052577d1c20a1bf9ee9ea4698f5c264b3cd7a5160cd6f

Observation 783d744a-e4aa-40e3-9e06-2d623bf2308c · outbound

This paper cites Open-vocabulary panop- tic segmentation with text-to-image diffusion models.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Open-vocabulary panop- tic segmentation with text-to-image diffusion models

Reference 94

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:09.909152Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.671346Z digest=sha256:46380586152f122f0f56e981bee7aacbfb53491f0e38a335614b4adcc1c4a8ad

Observation be5f2385-ce48-4bff-a520-1b547a610d1d · outbound

This paper cites Auf- fusion: Leveraging the power of diffusion and large lan- guage models for text-to-audio generation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Auf- fusion: Leveraging the power of diffusion and large lan- guage models for text-to-audio generation

Reference 95

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:09.890544Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.676975Z digest=sha256:d3d02c2e250f7c6371712f2083e55363cf11d9dde22303cacb6f13283edca32a

Observation e8c34cb8-e5e7-49d9-b3fb-412f0dd77e56 · outbound

This paper cites Draw an Audio: Leveraging Multi-Instruction for Video-to-Audio Synthesis.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Draw an Audio: Leveraging Multi-Instruction for Video-to-Audio Synthesis

Reference 96

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.683531Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.683531Z digest=sha256:1418217a9b320b5b9d43739b988900b09138beeb971bcbe1313be212cc1f4824

Observation 9f0a9c24-7b86-49fb-b758-a0fa974a616a · outbound

This paper cites CMMD: Contrastive Multi-Modal Diffusion for Video-Audio Conditional Modeling.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation CMMD: Contrastive Multi-Modal Diffusion for Video-Audio Conditional Modeling

Reference 97

Resolution
verified exact
local_arxiv, observed 2026-08-11T11:38:08.883104Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.689777Z digest=sha256:d3145f336e0c501045348b781f5a0f0c71b96d39ee32703cd3adbcfef79a7a4b

Observation a9d01660-7b03-48bc-982f-d3b2aa92b682 · outbound

This paper cites Diffusion model as rep- resentation learner.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Diffusion model as rep- resentation learner

Reference 98

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:09.870310Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.695444Z digest=sha256:f183fb5d0dff1b3fe9868da3636528f0fa85c09c2e16d89beefab434e1e8c980

Observation 90778f86-5f84-465a-b49b-884719eee09f · outbound

This paper cites CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer

Reference 99

Resolution
unresolved
no resolver link, observed 2026-08-11T11:38:08.701528Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:38:08.701528Z digest=sha256:409d2c0f4fb6f3778056ff09bbb32bbcdce702aa6aaa9507307d7e9b608fb162

Observation 2d3b3dbf-0b50-495d-8127-ac13507d7c48 · outbound

This paper cites Diverse and aligned audio-to- video generation via text-to-video model adaptation.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Diverse and aligned audio-to- video generation via text-to-video model adaptation

Reference 100

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:09.852365Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.708100Z digest=sha256:0b52f6680c6bb8385313f31506df79f3297eaaa62b38fe81c4a8ccd0b6c821dc

Observation 59f13910-172e-40cf-b89e-3d0a29552419 · outbound

This paper cites Momu-diffusion: On learning long-term motion-music synchronization and cor- respondence.

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation Momu-diffusion: On learning long-term motion-music synchronization and cor- respondence

Reference 101

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T11:38:09.835231Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T11:38:08.713130Z digest=sha256:ebcca64ff1057d21e40cde53eef9035774e9208cc15314c681e85fcdb822b99b

Pith citing papers

Observation 16755c82-6b7f-4480-9a83-682402e864d4 · inbound

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing cites this paper.

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-03T16:25:56.032167Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:25:56.032167Z digest=sha256:805807d79fa6a82e4b9aa5c4ad9a07e02c75f829d2b3a424fe4ceed865567b77