Pith. sign in

Paper Citation Record · LEDGER

VDT: General-purpose Video Diffusion Transformers via Mask Modeling

As of 12 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 21 inbound Pith citation observations for arXiv:2305.13311.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2305.13311 v2

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 21 of 21 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-12T06:34:41.77262+00:00

measured 21 of 21 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-12T12:58:57.214702Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

9
arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation d53398ab-3360-43d6-8f0c-cbf5fd591dd9 · inbound

Multimodal Diffusion Transformer with Memory Bank for Scalable Long-Duration Talking Video Generation cites this paper.

Multimodal Diffusion Transformer with Memory Bank for Scalable Long-Duration Talking Video Generation VDT: General-purpose Video Diffusion Transformers via Mask Modeling

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-05-23T17:23:15.373441Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-23T17:19:51.411937Z digest=sha256:b200d92b1cf8c7d85e9981e6d5c63d65cda336c16546e6c0d026c4458f4a7a0d

Observation 98c15704-7791-411b-ab39-520ae39c2635 · inbound

Towards Precise Scaling Laws for Video Diffusion Transformers cites this paper.

Towards Precise Scaling Laws for Video Diffusion Transformers VDT: General-purpose Video Diffusion Transformers via Mask Modeling

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-12T12:58:57.214702Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T12:58:57.214702Z digest=sha256:6da25ebf0cabcd3d009cea96adba916a3879b06b4e08b77e92e5ebfd782d8389

Observation aba8da3d-3592-41ea-862f-9e30436b6564 · inbound

LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity cites this paper.

LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity VDT: General-purpose Video Diffusion Transformers via Mask Modeling

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-11T16:43:08.347341Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T16:43:08.347341Z digest=sha256:1d5a42f65c10234339dfaef2919d7a462fb6fee199b3c8453779ad152e52cf69

Observation dfea9a48-193f-4814-a19e-181fdeb859fc · inbound

Video Diffusion Transformers are In-Context Learners cites this paper.

Video Diffusion Transformers are In-Context Learners VDT: General-purpose Video Diffusion Transformers via Mask Modeling

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-11T15:40:19.928134Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T15:40:19.928134Z digest=sha256:e656d3d02db4c146228862ce1c9ea901134352d0fc23e77aeb665f5d7f7d9297

Observation 07c42016-85f5-472c-adc4-66a3b3c75d9f · inbound

LazyDiT: Lazy Learning for the Acceleration of Diffusion Transformers cites this paper.

LazyDiT: Lazy Learning for the Acceleration of Diffusion Transformers VDT: General-purpose Video Diffusion Transformers via Mask Modeling

Reference 97

Resolution
unresolved
no resolver link, observed 2026-08-11T14:11:39.762166Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T14:11:39.762166Z digest=sha256:658885a61cd4aedf9b0735a77ab1a572122706da47b59964d968784bdd1a6c97

Observation c1e3a516-e946-44a5-aa02-3b496557c10a · inbound

Ingredients: Blending Custom Photos with Video Diffusion Transformers cites this paper.

Ingredients: Blending Custom Photos with Video Diffusion Transformers VDT: General-purpose Video Diffusion Transformers via Mask Modeling

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-10T22:25:25.713784Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T22:25:25.713784Z digest=sha256:c8da8c727f215af4ceece87a8e51257ec89ea4a86e98464c9fa49402f7a01c5d

Observation 02c3d018-1e44-432b-82c3-c7ee1224f517 · inbound

Humans Coexist, So Must Embodied Artificial Agents cites this paper.

Humans Coexist, So Must Embodied Artificial Agents VDT: General-purpose Video Diffusion Transformers via Mask Modeling

Reference 92

Resolution
unresolved
no resolver link, observed 2026-08-08T21:27:27.665102Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T21:27:27.665102Z digest=sha256:1605d476727067b6c0cd816628d0ef401fde1610a30e18f4baf34cae2b66ee9a

Observation 3f2a45de-1123-4c3e-b497-16d9f3cc2d8e · inbound

Programmatic Video Prediction Using Large Language Models cites this paper.

Programmatic Video Prediction Using Large Language Models VDT: General-purpose Video Diffusion Transformers via Mask Modeling

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T15:30:11.076093Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:30:11.076093Z digest=sha256:15ef9cde8fcc8839274de9158837cd3876cdc162a03ab13555b7ac3b92b8f133

Observation 94751a73-db32-4b8d-b28a-33147d4d9178 · inbound

A Diffusion-Driven Temporal Super-Resolution and Spatial Consistency Enhancement Framework for 4D MRI imaging cites this paper.

A Diffusion-Driven Temporal Super-Resolution and Spatial Consistency Enhancement Framework for 4D MRI imaging VDT: General-purpose Video Diffusion Transformers via Mask Modeling

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T10:52:20.620553Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:52:20.620553Z digest=sha256:bb7ffee7d461227d098ffbd1b7c43d85e3256ed332e97896e588dd06cc3d1567

Observation 7b5dc2f1-8125-41bc-abbf-083e22672a89 · inbound

SlotPi: Physics-informed Object-centric Reasoning Models cites this paper.

SlotPi: Physics-informed Object-centric Reasoning Models VDT: General-purpose Video Diffusion Transformers via Mask Modeling

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T04:25:21.115345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:25:21.115345Z digest=sha256:b63d1235b27cd442e64ab16b040ac0cfc8c7ed4396151b5422f8026aa66c7436

Observation b3cc039d-b35b-40d2-a7e8-2fd8a4a2cfeb · inbound

CDP: Towards Robust Autoregressive Visuomotor Policy Learning via Causal Diffusion cites this paper.

CDP: Towards Robust Autoregressive Visuomotor Policy Learning via Causal Diffusion VDT: General-purpose Video Diffusion Transformers via Mask Modeling

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-07T00:15:36.767344Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:15:36.767344Z digest=sha256:95019c814803e088826dd57f9d4072f7e93d4b78707135d92030e462671b8387

Observation d953c5ed-78b1-4ec9-b630-eafd96c91208 · inbound

Occlusion-Aware Temporally Consistent Amodal Completion for 3D Human-Object Interaction Reconstruction cites this paper.

Occlusion-Aware Temporally Consistent Amodal Completion for 3D Human-Object Interaction Reconstruction VDT: General-purpose Video Diffusion Transformers via Mask Modeling

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-06T18:32:07.604326Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:32:07.604326Z digest=sha256:40df38a2c5ded58ebfd0659ff434b3d74ff23b154632c4b09e5accbcc89c7d12

Observation e63c317d-8fb1-4ab8-834a-a3f293f0c9f1 · inbound

FrameDiT: Diffusion Transformer with Matrix Attention for Efficient Video Generation cites this paper.

FrameDiT: Diffusion Transformer with Matrix Attention for Efficient Video Generation VDT: General-purpose Video Diffusion Transformers via Mask Modeling

Reference 30

Resolution
verified exact
arxiv_id, observed 2026-05-15T13:30:01.641887Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-15T13:27:23.641294Z digest=sha256:56891b06dd4291321df0b0e6eab1d3f220e9afea78aa2d75b2a5959d31e0cd70

Observation f0f3de94-adc4-462e-bb64-48cdb652fa7f · inbound

Evolution of Video Generative Foundations cites this paper.

Evolution of Video Generative Foundations VDT: General-purpose Video Diffusion Transformers via Mask Modeling

Reference 75

Resolution
verified exact
arxiv_id, observed 2026-05-11T00:05:51.901440Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-10T18:41:38.616611Z digest=sha256:dfe754a3f85eaaf4d77ee757ca9488aec9e0eefffc5b2fd8959a17c833218c5e

Observation b2d8d975-3e1f-4fd2-8d86-bb9b76a574b5 · inbound

AttentionBender: Manipulating Cross-Attention in Video Diffusion Transformers as a Creative Probe cites this paper.

AttentionBender: Manipulating Cross-Attention in Video Diffusion Transformers as a Creative Probe VDT: General-purpose Video Diffusion Transformers via Mask Modeling

Reference 41

Resolution
verified exact
arxiv_id, observed 2026-05-09T22:44:14.223864Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-09T22:42:52.758195Z digest=sha256:12352e12566566207c1dee697a239c49ca75f56faf3dea9a0bf26a3b68aa0e76

Observation 990ea3a2-01aa-4a43-ae24-9d4cb62f2915 · inbound

RoPeSLR: 3D RoPE-driven Sparse-LowRank Attention for Efficient Diffusion Transformers cites this paper.

RoPeSLR: 3D RoPE-driven Sparse-LowRank Attention for Efficient Diffusion Transformers VDT: General-purpose Video Diffusion Transformers via Mask Modeling

Reference 13

Resolution
verified exact
arxiv_id, observed 2026-05-21T05:59:41.193525Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T05:55:24.854370Z digest=sha256:bbe0f23bc908279f2493652e79caa856402fbeba19ed7b9eeb3c3113f1ddced1

Observation 5add65a5-3203-43e5-8015-5ce370165b68 · inbound

Lumos-Nexus: Efficient Frequency Bridging with Homogeneous Latent Space for Video Unified Models cites this paper.

Lumos-Nexus: Efficient Frequency Bridging with Homogeneous Latent Space for Video Unified Models VDT: General-purpose Video Diffusion Transformers via Mask Modeling

Reference 28

Resolution
verified exact
arxiv_id, observed 2026-07-01T19:16:00.515140Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-28T22:56:21.783415Z digest=sha256:d607e86cdd31f75a8ac875f7d3b9e00996a2ad6f2f22bbad9d545abdb57cbcff

Observation ae5a5a8c-e90f-41f3-bcc4-52db6470c2c7 · inbound

Making Time Editable in Video Diffusion Transformers cites this paper.

Making Time Editable in Video Diffusion Transformers VDT: General-purpose Video Diffusion Transformers via Mask Modeling

Reference 7

Resolution
verified exact
arxiv_id, observed 2026-07-03T01:27:30.543674Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-27T16:36:43.699031Z digest=sha256:cf29e9b06cb8354102535334a2ca66b4c7278d0ead684a3c05ab965108ad0a47

Observation 1ed778b5-98cf-465b-b266-3402215d1a42 · inbound

GF-DiT: Scheduling Parallelism for Diffusion Transformer Serving cites this paper.

GF-DiT: Scheduling Parallelism for Diffusion Transformer Serving VDT: General-purpose Video Diffusion Transformers via Mask Modeling

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-07-03T16:28:39.264040Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-27T05:35:01.339479Z digest=sha256:f490266dd33ed1301c50dee9b35f97cff1a886c5852035e59bc0de419acb6986

Observation 203d95ca-f739-4e03-a6c7-298f6bf60b50 · inbound

GF-DiT: Scheduling Parallelism for Diffusion Transformer Serving cites this paper.

GF-DiT: Scheduling Parallelism for Diffusion Transformer Serving VDT: General-purpose Video Diffusion Transformers via Mask Modeling

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-07-03T23:59:06.282886Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-07-03T23:50:39.241880Z digest=sha256:0fb71b33f0acfc65437cdd9be05362762e526da6bea7294e23c331393b8615c6

Observation ad69f700-651d-40a0-ad7c-ccff0ffc90c6 · inbound

Event Stream based Multi-Modal Video Anomaly Detection: A Benchmark Dataset and Algorithms cites this paper.

Event Stream based Multi-Modal Video Anomaly Detection: A Benchmark Dataset and Algorithms VDT: General-purpose Video Diffusion Transformers via Mask Modeling

Reference 83

Resolution
unresolved
no resolver link, observed 2026-07-13T05:19:39.977367Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T05:19:39.977367Z digest=sha256:907f4ddf216133085f5971b027ba0baacbdc486625c8540cc62eb1b4dd33c12a