Pith. sign in

Paper Citation Record · LEDGER

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation

As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 11 inbound Pith citation observations for arXiv:2502.03897.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2502.03897 v5

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 11 of 11 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 11 of 11 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-06T13:07:28.480478Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-02T05:56:40.900641Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation a65d3b03-373a-4102-baa0-0f2224156e3b · inbound

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 cites this paper.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.480478Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.480478Z digest=sha256:3a5780022a7bd50c4547fc016f400a43c3a2cd93f475014b40ffb007f5f16d4d

Observation 4e3600b3-5b03-43bb-aa81-f95b258b9571 · inbound

UniVerse-1: Unified Audio-Video Generation via Stitching of Experts cites this paper.

UniVerse-1: Unified Audio-Video Generation via Stitching of Experts UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-05T00:05:47.719488Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T00:05:47.719488Z digest=sha256:b33751e37c51b50d18eb715d66586eca09accd8e5757bc0136d45eef5c75bfab

Observation fe916510-e314-4523-bf4a-49e286c8d953 · inbound

Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction cites this paper.

Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-04T12:38:59.844041Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T12:38:59.844041Z digest=sha256:e31989d14865c50292df0b20c6486bdc591713945fd083fe20d5bac7aaa41db2

Observation 86a4669c-fe76-4651-b85e-aec31796905f · inbound

PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation cites this paper.

PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation

Reference 19

Resolution
verified exact
arxiv_id, observed 2026-05-16T19:48:21.911645Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-16T19:43:37.604351Z digest=sha256:a1a939238a7874a7151552add7984376de2a806ad6b486e7b04269e71343e1bc

Observation 750fb1d0-85b6-4f75-8733-d431af5e8148 · inbound

PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation cites this paper.

PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation

Reference 19

Resolution
verified exact
arxiv_id, observed 2026-05-21T16:14:15.270070Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-21T16:10:31.015783Z digest=sha256:086f23ab6290766773e4f17267bb6ba6f525d96835e74cce31337ba0e0256345

Observation 195a3271-7eee-405d-a737-f4f90e7b23f6 · inbound

Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation cites this paper.

Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation

Reference 49

Resolution
verified exact
arxiv_id, observed 2026-05-12T07:36:44.178576Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-12T02:28:14.734682Z digest=sha256:7e36db53d3b6f34066905b04ae649efdf2bed064b28e7c8be5f201b41acf2614

Observation 36151287-89fb-4b24-b8e5-a1965a16360e · inbound

Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation cites this paper.

Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation

Reference 49

Resolution
verified exact
arxiv_id, observed 2026-06-30T23:35:07.816253Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-06-30T23:26:46.077894Z digest=sha256:a538075b33e08b72c6f8842bdea874cbe6eaec138680311af09960ba274efe85

Observation 5472edbe-229b-4705-bada-76c3b06531ac · inbound

SyncDPO: Enhancing Temporal Synchronization in Video-Audio Joint Generation via Preference Learning cites this paper.

SyncDPO: Enhancing Temporal Synchronization in Video-Audio Joint Generation via Preference Learning UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation

Reference 52

Resolution
verified exact
arxiv_id, observed 2026-05-13T07:02:27.198346Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-13T07:01:40.333448Z digest=sha256:89ba7cb6c6e822005a7ba4ac87f16cb24062e63ed261380a19312df592f26c16

Observation 432bf714-ac4c-41fc-8b02-6979188d94b2 · inbound

MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation cites this paper.

MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation

Reference 76

Resolution
verified exact
arxiv_id, observed 2026-05-20T05:18:03.069935Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-20T05:17:11.690484Z digest=sha256:08f21f13a143ab568fe9139886ad1bc957cbc448312de829df1bec2604bf2788

Observation 38385add-b7cf-4a4e-ad03-983f4a143131 · inbound

MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation cites this paper.

MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation

Reference 76

Resolution
verified exact
arxiv_id, observed 2026-06-30T18:04:58.099423Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-06-30T18:00:39.556424Z digest=sha256:261ada6fca629fb46437e020eb40e7ed0fbe33aee8643d7e464074f8824d6591

Observation 8e276bec-38a2-4b47-87aa-98b4275b5842 · inbound

Inference-Time Scaling for Joint Audio-Video Generation cites this paper.

Inference-Time Scaling for Joint Audio-Video Generation UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation

Reference 13

Resolution
verified exact
arxiv_id, observed 2026-07-02T05:56:40.902116Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-06-28T07:49:20.194990Z digest=sha256:9121a1e24ce413a034f134017fa8d3ba203d9e4ca3c4f86eba35a8ea8bc91601