Pith. sign in

Paper Citation Record · LEDGER

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation

As of 23 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 12 inbound Pith citation observations for arXiv:2502.03897.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2502.03897 v5

Coverage vector

measured 43 of 43 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-09T00:23:08.279261Z

measured 55 of 55 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-23T06:30:58.430688+00:00

measured 12 of 12 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T23:16:52.548806Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-02T05:56:40.900641Z

Reference resolution

43 of 43 outbound references displayed

  • verified exact0
  • verified fuzzy29
  • unresolved14
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation eb615f65-4ba6-4ee9-b023-b5e053e3c579 · outbound

This paper cites Scaling instruction-finetuned language models,.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation Scaling instruction-finetuned language models,

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T00:23:08.939481Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T00:23:08.073414Z digest=sha256:60c9b137a9230e6466a4762928459e597b02d124481b66dd036a77d552f47db7

Observation f0b09ba4-a94f-4ce7-aa0e-878c7af1993b · outbound

This paper cites Enhanced visual instruction tuning with synthesized image-dialogue data,.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation Enhanced visual instruction tuning with synthesized image-dialogue data,

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T00:23:08.924486Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T00:23:08.079309Z digest=sha256:3af0e5598f196c9840327ef062b47dff0a2aedc7e26d7e6f311446a405646df4

Observation 2ab83cb4-5302-43a1-ba55-d45aaeb2241c · outbound

This paper cites High-resolution image synthesis with latent diffusion models,.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation High-resolution image synthesis with latent diffusion models,

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T00:23:08.909334Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T00:23:08.084674Z digest=sha256:a3db35184d43db3301e6d0f02717281e0be343c947831cf2db66461edd2731c6

Observation ebf2eaa4-9386-4918-89b0-5817a85a3a01 · outbound

This paper cites Label-guided generative adversarial network for realistic image synthesis,.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation Label-guided generative adversarial network for realistic image synthesis,

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T00:23:08.894367Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T00:23:08.090212Z digest=sha256:528f1462aa9630304f6d5e9b5c2eabb858771a1e91b16389ccccf6a6a433ef78

Observation dbde849d-a369-4623-8afc-e976d57b79a9 · outbound

This paper cites Audioldm 2: Learn- ing holistic audio generation with self-supervised pretraining,.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation Audioldm 2: Learn- ing holistic audio generation with self-supervised pretraining,

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-09T00:23:08.095460Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T00:23:08.095460Z digest=sha256:913a3e8612b5bfe7c4a3ca89ca1816b0a28a427fd3c1301dab97c146df0f83c4

Observation 8664b6c0-2d65-4958-a1d7-29f336028c52 · outbound

This paper cites Continuous emotion-based image-to-music generation,.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation Continuous emotion-based image-to-music generation,

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T00:23:08.869392Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T00:23:08.100701Z digest=sha256:9fa0d0d3892d84bc3c62ee11dbc9a8d4df500cf5a8f4974dd52ac47799b3546c

Observation 3f50a790-a285-458a-a68b-6cf1940de7c4 · outbound

This paper cites DreamFrame: Enhancing Video Understanding via Automatically Generated QA and Style-Consistent Keyframes.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation DreamFrame: Enhancing Video Understanding via Automatically Generated QA and Style-Consistent Keyframes

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-09T00:23:08.106301Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T00:23:08.106301Z digest=sha256:5cc743f29b8239ff9adf4a75bfe22f192e55eaa7ca3520f2ea8765f1a09399a5

Observation 5910f92a-b6dc-46fa-ab13-7ea114396aa7 · outbound

This paper cites Open-Sora: Democratizing Efficient Video Production for All.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation Open-Sora: Democratizing Efficient Video Production for All

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-09T00:23:08.111482Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T00:23:08.111482Z digest=sha256:6e09452e0d4e2e0045bbb9b2f4322e893b8710879f91274dedfa5a16b3dbcdc9

Observation feaac7ae-57ea-42c7-b5aa-f90d78bff2a2 · outbound

This paper cites Make-a-video: Text-to-video generation without text-video data,.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation Make-a-video: Text-to-video generation without text-video data,

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T00:23:08.854523Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T00:23:08.116640Z digest=sha256:be2d90940a4584c8ac61a2ed5b76f24032a51e820c5ffe721c2451b50e23c73c

Observation 002714fa-c740-45ed-9635-e8fb280aefd2 · outbound

This paper cites Align your latents: High-resolution video synthesis with latent diffusion models,.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation Align your latents: High-resolution video synthesis with latent diffusion models,

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T00:23:08.839801Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T00:23:08.121660Z digest=sha256:a78052d734ef87a018c24f3a21f4342c1ad5ecb5e1293004c9e908e295a0b76f

Observation ce0abe09-7a46-43f0-b842-5c0468621d8f · outbound

This paper cites Lavie: High-quality video generation with cascaded latent diffusion models,.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation Lavie: High-quality video generation with cascaded latent diffusion models,

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T00:23:08.825411Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T00:23:08.126362Z digest=sha256:83d18ee90cb81d504fa86c1e8e74e933a8ef5d79610c4d4b7ebff98962ac06ac

Observation 07880440-c68c-4ad9-a1d6-90223bad2a21 · outbound

This paper cites Mm-diffusion: Learning multi-modal diffusion models for joint audio and video generation,.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation Mm-diffusion: Learning multi-modal diffusion models for joint audio and video generation,

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T00:23:08.810670Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T00:23:08.131422Z digest=sha256:883cf3566ff5cef1cff05e8dff7e89ec5783d1f0918cb7366755757631aa631d

Observation bc0aa074-385f-4126-b52c-27a985094677 · outbound

This paper cites Mm-ldm: Multi-modal latent diffusion model for sounding video generation,.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation Mm-ldm: Multi-modal latent diffusion model for sounding video generation,

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T00:23:08.796083Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T00:23:08.136257Z digest=sha256:c0098c80a424ea070fc1a422f33ff8b1f016343afbc601f5c4544fd0b1074c2b

Observation 1c12b223-f672-482f-8076-7c5d1280b56b · outbound

This paper cites Scalable diffusion models with trans- formers,.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation Scalable diffusion models with trans- formers,

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T00:23:08.780892Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T00:23:08.140806Z digest=sha256:8c87a61f19ceb49572a066e114898d870ec8277308ac6bb0d0bce80f7fadff01

Observation 7140319c-c2c3-472b-9d74-28f2498a66e8 · outbound

This paper cites Mmdisco: Multi-modal discriminator-guided cooperative diffusion for joint audio and video generation,.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation Mmdisco: Multi-modal discriminator-guided cooperative diffusion for joint audio and video generation,

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T00:23:08.765428Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T00:23:08.145376Z digest=sha256:bc01aed881d687fa40c4a72f939e7f93d2a9548e4bf558c7b6b5e258ade9acac

Observation 78bd0cc2-3f69-46da-b5b9-4234d5abef5e · outbound

This paper cites AV-DiT: Efficient Audio-Visual Diffusion Transformer for Joint Audio and Video Generation.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation AV-DiT: Efficient Audio-Visual Diffusion Transformer for Joint Audio and Video Generation

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-09T00:23:08.150079Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T00:23:08.150079Z digest=sha256:7e219d2cbd4b8d59caac5a16e6c10a288221554e849f8a5c8010eedf60933ea0

Observation 9eaaf7fb-2fee-45e3-96dd-0f55327083a3 · outbound

This paper cites Seeing and hearing: Open-domain visual-audio generation with diffusion latent aligners,.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation Seeing and hearing: Open-domain visual-audio generation with diffusion latent aligners,

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T00:23:08.749722Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T00:23:08.154852Z digest=sha256:4fdf24bedf78663a4efa3e70119daba480c56079714622e9fd2cde33b4b50d66

Observation d9f13782-2114-4f28-9752-f3c33f17ac6d · outbound

This paper cites Foley Sound Synthesis at the DCASE 2023 Challenge.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation Foley Sound Synthesis at the DCASE 2023 Challenge

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-09T00:23:08.159950Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T00:23:08.159950Z digest=sha256:ac7d6a7575f6a5914ed80ca0f1fa6344b336c87793ee1381172441d9f59d4110

Observation b07248fb-7b9c-4807-be26-6b34a7feffc8 · outbound

This paper cites Conditional sound generation using neural discrete time-frequency representation learning,.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation Conditional sound generation using neural discrete time-frequency representation learning,

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T00:23:08.734547Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T00:23:08.164988Z digest=sha256:c9ddbd7772eb1265bde230a01ae59f7e40de607cbc7a9ae4998ad46ec936963a

Observation c7bdd247-464b-4263-b9e2-d78b0daa5d70 · outbound

This paper cites Audioldm: Text-to-audio generation with latent diffusion models,.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation Audioldm: Text-to-audio generation with latent diffusion models,

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T00:23:08.719456Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T00:23:08.169478Z digest=sha256:77a4680a6b141f2191bdeaa207a8ffab08e04bd5a4497176ba2d07dd79d1c4c7

Observation 64883c8d-8162-4ce4-91be-88c0f9a550ec · outbound

This paper cites Taming Visually Guided Sound Generation.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation Taming Visually Guided Sound Generation

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-09T00:23:08.173861Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T00:23:08.173861Z digest=sha256:4b6fae9e1b4f5c3d906dbe6e59d690e0ad3cb8c56c59976852773fcabff4c3d2

Observation 85bdd7f3-6e09-4ac7-a8aa-0412476b1f80 · outbound

This paper cites Con- ditional generation of audio from video via foley analogies,.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation Con- ditional generation of audio from video via foley analogies,

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T00:23:08.704609Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T00:23:08.178960Z digest=sha256:955adcfd7426c32de71bf2c9d1692a25a871942878ca65a0a9502135dd4fe626

Observation f8bc7a9e-a1ad-4621-b474-6e489e3f1578 · outbound

This paper cites Diff-foley: Synchro- nized video-to-audio synthesis with latent diffusion models,.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation Diff-foley: Synchro- nized video-to-audio synthesis with latent diffusion models,

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T00:23:08.688866Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T00:23:08.183545Z digest=sha256:19612bcd061d5c757a5b0777d65ac5e7bdd7d25fc595e9f62d98944efe71e00a

Observation 3650c39e-68d2-4981-9145-f8c25141abf9 · outbound

This paper cites FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-09T00:23:08.188006Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T00:23:08.188006Z digest=sha256:ce11394c5175c00c564bd07159ed3a1483d79d70ef095a202994240b63db60f6

Observation a7bd70ed-4be5-4cb0-9df4-5bf5ce4cc987 · outbound

This paper cites Temporally aligned audio for video with autoregression,.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation Temporally aligned audio for video with autoregression,

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T00:23:08.672241Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T00:23:08.193050Z digest=sha256:d50061cb1f764f59e36a20a37a9f84d8c6f120d4e5fb7e629532dabd13e1acb1

Observation bd44a722-c613-4d0f-a766-13a72221c16e · outbound

This paper cites Tell What You Hear From What You See -- Video to Audio Generation Through Text.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation Tell What You Hear From What You See -- Video to Audio Generation Through Text

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-09T00:23:08.197960Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T00:23:08.197960Z digest=sha256:f92ff24ded4ab991babc0932e810f8144c44d8dd8a322e8124c66578825d5fb6

Observation 50349149-657d-4dfc-b7a3-016504b7f5df · outbound

This paper cites Frieren: Efficient video-to-audio generation network with rectified flow matching,.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation Frieren: Efficient video-to-audio generation network with rectified flow matching,

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T00:23:08.657337Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T00:23:08.202869Z digest=sha256:9f528ad3e90bbb32476a2eb4ff278976c9a82b333660b91f101066169fed2074

Observation 923602d6-db73-44ca-9b3f-e184c7770c71 · outbound

This paper cites Sound-guided semantic video generation,.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation Sound-guided semantic video generation,

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T00:23:08.641726Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T00:23:08.207696Z digest=sha256:feb58a9e5b87b5cb898f475618bf355e78cd8b526602db1d25316c55d10ef35f

Observation b4aefb80-8523-4756-b44a-0fd2be59938e · outbound

This paper cites The power of sound (tpos): Audio reactive video gen- eration with stable diffusion,.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation The power of sound (tpos): Audio reactive video gen- eration with stable diffusion,

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T00:23:08.626702Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T00:23:08.212365Z digest=sha256:772e36c4147979834af55a7fcd9576000d21716d73e30ac3df21bed86fbf2a3c

Observation 9fe97c13-9c88-4e1c-bdbf-17a4e0228cd8 · outbound

This paper cites Diverse and aligned audio-to-video generation via text-to-video model adaptation,.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation Diverse and aligned audio-to-video generation via text-to-video model adaptation,

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T00:23:08.611766Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T00:23:08.217083Z digest=sha256:cc51f907b3fca5b4a660e2747d4b4e21951bf522a29f9f86a189cd051205254e

Observation f49398eb-38ea-4e18-b229-589ac817dd69 · outbound

This paper cites Hierarchical Text-Conditional Image Generation with CLIP Latents.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation Hierarchical Text-Conditional Image Generation with CLIP Latents

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-09T00:23:08.221778Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T00:23:08.221778Z digest=sha256:991a8178be9464fc8059bffeea5f51c7834d15c3c73fe2d97b161f2b2402081b

Observation fe0d57e8-7353-4b1b-84fe-0b7ddc3d78e4 · outbound

This paper cites Denoising diffusion probabilistic models,.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation Denoising diffusion probabilistic models,

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-09T00:23:08.226795Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T00:23:08.226795Z digest=sha256:23998bcf7e4a1c0e680e87d25bef68d96c2ce7b5a9a42cd2ca8d25bfaffb7f5c

Observation 80ae537c-c41d-4ad7-a043-f2ce4b6e3f48 · outbound

This paper cites Classifier-free diffusion guidance,.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation Classifier-free diffusion guidance,

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T00:23:08.587790Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T00:23:08.231336Z digest=sha256:fac83e07ed31fc6648cd8fa815544e5ea992a6da8d53b8f0831713c7e16d663a

Observation d4b9864b-da9b-49de-aaf9-2e154250529f · outbound

This paper cites Denoising diffusion implicit models,.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation Denoising diffusion implicit models,

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T00:23:08.572749Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T00:23:08.236123Z digest=sha256:1ed83fa4017d69366ec212117625003de5dbad73c7e306860fd7a23204e9d7f8

Observation d14f49b8-6357-4433-a39b-5cab2d52ce44 · outbound

This paper cites Exploring the limits of transfer learning with a unified text-to-text transformer,.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation Exploring the limits of transfer learning with a unified text-to-text transformer,

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-09T00:23:08.240853Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T00:23:08.240853Z digest=sha256:c1a224d7aa5417e433a86dddbeb43a53528466e02b37d35cd4b8836b94a9a56f

Observation caa2c650-9b39-4202-99b4-4168df74a94b · outbound

This paper cites Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis,.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis,

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T00:23:08.546974Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T00:23:08.245669Z digest=sha256:edf04d86c73f758ed085d4b40946c848d837f8cafe0233d72e346cc8e8587c82

Observation 266eeb2a-d640-4b3e-8d00-02744a31c756 · outbound

This paper cites Vggsound: A large-scale audio-visual dataset,.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation Vggsound: A large-scale audio-visual dataset,

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T00:23:08.531559Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T00:23:08.250345Z digest=sha256:9f24abd74c2df161f69ecb4b568e23c904bcbd231b54d1f4753019261d738902

Observation 2fe81b8f-01fb-4973-bf7d-b1b073a6ae4d · outbound

This paper cites Ai choreog- rapher: Music conditioned 3d dance generation with aist++,.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation Ai choreog- rapher: Music conditioned 3d dance generation with aist++,

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T00:23:08.516275Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T00:23:08.255030Z digest=sha256:fca79407f4aff2fab2b0d517d46ba30b666cfd74e5bd753320cbe676c8837280

Observation b4451862-8e35-4abb-b5f5-be8b6e6cecb7 · outbound

This paper cites Audio set: An ontology and human-labeled dataset for audio events,.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation Audio set: An ontology and human-labeled dataset for audio events,

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T00:23:08.500522Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T00:23:08.259716Z digest=sha256:0bc3189082dbbe4181764725e3dcccbda417874cffb706ffdac6196cf630f393

Observation 0d4e6590-ae9c-439f-93b0-dd4cd9c76806 · outbound

This paper cites The benefit of temporally-strong labels in audio event classification,.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation The benefit of temporally-strong labels in audio event classification,

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T00:23:08.484410Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T00:23:08.264537Z digest=sha256:616b19c6bd0de156b2577899cd3fda6b0ff2cc8b3a795a104716c83852eab809

Observation cf39378f-b5b5-42de-aaf6-65dea21aaef0 · outbound

This paper cites Aist dance video database: Multi-genre, multi-dancer, and multi- camera database for dance information processing.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation Aist dance video database: Multi-genre, multi-dancer, and multi- camera database for dance information processing

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-09T00:23:08.269384Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T00:23:08.269384Z digest=sha256:08420ffe496792caa0c94f8df43560ac3ac0d56eb97f6f10bec493b24933da32

Observation e5033d48-6d2a-4146-939b-5c3e6f9f99bb · outbound

This paper cites PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-09T00:23:08.274133Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T00:23:08.274133Z digest=sha256:32f8bcb9023c981336cc7fbbaaa1efb099791682227c2fdad846766cdc5a19ba

Observation e23d8b30-0744-4a48-9ac9-f57a8679632d · outbound

This paper cites PIXART-{\delta}: Fast and Controllable Image Generation with Latent Consistency Models.

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation PIXART-{\delta}: Fast and Controllable Image Generation with Latent Consistency Models

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-09T00:23:08.279261Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T00:23:08.279261Z digest=sha256:dd09c51ff9e59bc00afd93c593a690afa8fd9aee3ed38715c6c6b88de336a245

Pith citing papers

Observation a65d3b03-373a-4102-baa0-0f2224156e3b · inbound

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 cites this paper.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.480478Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.480478Z digest=sha256:db5d1d5402f14532ab976220bc5391c6faa29de6d655889b0d1f4f3882b953a3

Observation 4e3600b3-5b03-43bb-aa81-f95b258b9571 · inbound

UniVerse-1: Unified Audio-Video Generation via Stitching of Experts cites this paper.

UniVerse-1: Unified Audio-Video Generation via Stitching of Experts UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-05T00:05:47.719488Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T00:05:47.719488Z digest=sha256:1fcea308988daf64f4076956efb62e08bb1b92e95879400455b5e38fd86d8963

Observation fe916510-e314-4523-bf4a-49e286c8d953 · inbound

Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction cites this paper.

Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-04T12:38:59.844041Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T12:38:59.844041Z digest=sha256:e3b6001881b2ff23ec3739c30e69e3e04c83b2d050be17a80963f5a2e79a3e89

Observation 86a4669c-fe76-4651-b85e-aec31796905f · inbound

PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation cites this paper.

PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation

Reference 19

Resolution
verified exact
arxiv_id, observed 2026-05-16T19:48:21.911645Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-16T19:43:37.604351Z digest=sha256:c9efc658b93ca409679f2ccabaeb33aef7304f1cd6d128901802750fb48d011f

Observation 750fb1d0-85b6-4f75-8733-d431af5e8148 · inbound

PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation cites this paper.

PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation

Reference 19

Resolution
verified exact
arxiv_id, observed 2026-05-21T16:14:15.270070Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T16:10:31.015783Z digest=sha256:e2fb11c1e8c5f5b4feb516e2d1455101a935947f71d5da1cb31b97098daf9cf9

Observation 195a3271-7eee-405d-a737-f4f90e7b23f6 · inbound

Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation cites this paper.

Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation

Reference 49

Resolution
verified exact
arxiv_id, observed 2026-05-12T07:36:44.178576Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-12T02:28:14.734682Z digest=sha256:5b26ef2492e450514f80d37138e8395fc76362e92701cc32ce854870864046c1

Observation 36151287-89fb-4b24-b8e5-a1965a16360e · inbound

Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation cites this paper.

Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation

Reference 49

Resolution
verified exact
arxiv_id, observed 2026-06-30T23:35:07.816253Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-06-30T23:26:46.077894Z digest=sha256:b460308fab105ed4f8c745482931805f3cb36b15b139f45eeac4ef4dc43b28af

Observation 5472edbe-229b-4705-bada-76c3b06531ac · inbound

SyncDPO: Enhancing Temporal Synchronization in Video-Audio Joint Generation via Preference Learning cites this paper.

SyncDPO: Enhancing Temporal Synchronization in Video-Audio Joint Generation via Preference Learning UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation

Reference 52

Resolution
verified exact
arxiv_id, observed 2026-05-13T07:02:27.198346Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-13T07:01:40.333448Z digest=sha256:0cb531ae6985e5cf0082fa472c65b527b566e6a9c254b994a0c7e6a93c375a1e

Observation 432bf714-ac4c-41fc-8b02-6979188d94b2 · inbound

MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation cites this paper.

MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation

Reference 76

Resolution
verified exact
arxiv_id, observed 2026-05-20T05:18:03.069935Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-20T05:17:11.690484Z digest=sha256:d3f65215540c862d0797da857ea79f83b8a96e0765dadeacdae9704251c410fb

Observation 38385add-b7cf-4a4e-ad03-983f4a143131 · inbound

MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation cites this paper.

MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation

Reference 76

Resolution
verified exact
arxiv_id, observed 2026-06-30T18:04:58.099423Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-06-30T18:00:39.556424Z digest=sha256:09e8a32f0519400b1f1d5b960d2e8359a5f162dcce46f6a16688a86842988de0

Observation 8e276bec-38a2-4b47-87aa-98b4275b5842 · inbound

Inference-Time Scaling for Joint Audio-Video Generation cites this paper.

Inference-Time Scaling for Joint Audio-Video Generation UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation

Reference 13

Resolution
verified exact
arxiv_id, observed 2026-07-02T05:56:40.902116Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-06-28T07:49:20.194990Z digest=sha256:1cdb41e491543a8011066695a1885e11d3f1c47a93f967cbbdb2b98b7e40c59c

Observation dd650d56-eda4-4d06-80ef-7bbfaa557f56 · inbound

Vorch-Omni: Multi-Task Orchestration of Sight and Sound cites this paper.

Vorch-Omni: Multi-Task Orchestration of Sight and Sound UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T23:16:52.548806Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T23:16:52.548806Z digest=sha256:ec880e31bc06a38bad4fa7311cfd91642c3bc04e70bc1fdf751529bf7ee1b3ca