Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-04T18:58:11.054269Z
Paper Citation Record · LEDGER
As of 22 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2509.09547.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-04T18:58:11.054269Z
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-22T06:32:14.747728+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links
A source-named dated measurement, never combined with another source.
Source: cited_works
38 of 38 outbound references displayed
External citation measurements
No source-named external measurement is stored.
Observation 26eb7b67-5785-468d-ba32-3b6f849bf9e8 · outbound
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders Goku: Flow Based Video Generative Foundation Models
Reference 3
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0ed44e74-360b-4127-8c72-81f4380afe1a · outbound
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders Motivated by this trend, we also analyzed the vision encoder used in a state-of-the-art MLLM to better understand its po- tential for video generation tasks
Reference 4
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7a6f59ae-cc4d-443a-b019-bf176068a81e · outbound
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders TokenFlow: Consistent Diffusion Features for Consistent Video Editing
Reference 5
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c02f7f1d-9315-4a20-8b56-bd70303c5a9e · outbound
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning
Reference 6
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f57d9569-41e4-4ca2-835d-ddd1a8fb5616 · outbound
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders LTX-Video: Realtime Video Latent Diffusion
Reference 7
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c6d61e40-6b87-49a5-8bfd-613e72c48ce7 · outbound
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders JOG3R: Towards 3D-Consistent Video Generators
Reference 10
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7efd77b1-8cd2-4244-8b9d-ae20be33c484 · outbound
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders Track4Gen: Teaching Video Diffusion Models to Track Points Improves Video Generation
Reference 11
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b4590f58-eee7-4510-981c-5546c821b0ba · outbound
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders Exploring Temporally-Aware Features for Point Tracking
Reference 12
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a74e50d2-734c-49bc-bfd3-f7faa0312de4 · outbound
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders HunyuanVideo: A Systematic Framework For Large Video Generative Models
Reference 13
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation cb39bf73-02a7-4928-9c5d-776b76021199 · outbound
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow
Reference 15
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 70974366-1796-44bb-9adf-73557c0f3467 · outbound
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model
Reference 16
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 20fbdfa8-1737-4a96-a3c7-1e36bb9987ea · outbound
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders Latte: Latent Diffusion Transformer for Video Generation
Reference 17
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation dab65f3f-0119-4ca4-8306-636dee8c7695 · outbound
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation
Reference 18
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a84fc41f-d59e-4365-91d8-4c89d2d02fec · outbound
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis
Reference 19
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ed61d7da-adb1-4e8f-bfea-3a36ff56f536 · outbound
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders Movie Gen: A Cast of Media Foundation Models
Reference 20
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0cd651a4-d122-43a5-9c68-3bcabeb37969 · outbound
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders SAM 2: Segment Anything in Images and Videos
Reference 21
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a14a2fc1-8be7-4e86-8bcf-a24956c4e526 · outbound
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders FaceForensics: A Large-scale Video Dataset for Forgery Detection in Human Faces
Reference 22
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e850c45d-85ec-453b-9861-d6de8c5f9c97 · outbound
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders Make-A-Video: Text-to-Video Generation without Text-Video Data
Reference 23
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 023655bb-12a9-472c-b6ef-6cfd1a033d53 · outbound
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders arXiv:2502.06755
Reference 26
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 32143b16-82f4-4cd2-955b-d7be0b1c4bfa · outbound
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders DUSt3R: Geometric 3D Vision Made Easy
Reference 29
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4474b6c3-8f6c-4003-add1-d6376784c4be · outbound
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation
Reference 30
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0caf6e20-38e6-4699-8cc2-643cf12b1d78 · outbound
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer
Reference 31
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0ee73c7b-dd24-4c7e-af27-0e254d57ea36 · outbound
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think
Reference 32
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation acaa8341-38dc-40b5-9112-76a1cd7fe508 · outbound
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders MonST3R: A Simple Approach for Estimating Geometry in the Presence of Motion
Reference 33
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 30b5a8eb-6250-443c-88e6-b9ba1b99d06c · outbound
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders Allegro: Open the Black Box of Commercial-Level Video Generation Model
Reference 34
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e0e99ed2-34da-4416-a43f-9e67902b292c · outbound
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders Unresolved cited work
Reference 35
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d80ade39-1e31-4951-a917-832cf523219c · outbound
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders We follow the same protocol as SkyTimeLapse, using the training split for both model training and metric evaluations
Reference 36
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b42b5a19-1675-4d4e-b843-4317b198fca6 · outbound
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders Unresolved cited work
Reference 37
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation efe36236-3ec3-44db-89c3-4ac383d3aee4 · outbound
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild
Reference 2012
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4ad22f3d-e6d7-46ea-903b-8b16bd825241 · outbound
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders Learning Spatiotemporal Features with 3D Convolutional Networks
Reference 2015
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 55714084-7ff2-4085-814b-b1580248107e · outbound
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders GANs Trained by a Two Time-Scale Update Rule Converge to a Local Nash Equilibrium
Reference 2018
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 57b70c0c-7f6c-4230-b65a-1b5ff02f817b · outbound
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders Towards Accurate Generative Models of Video: A New Metric & Challenges
Reference 2019
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 02cf6cb7-f7c8-46e1-8125-756c1754cef0 · outbound
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders Denoising Diffusion Implicit Models
Reference 2020
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 2987a97f-4eed-45ad-af7d-840e56491d7f · outbound
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders Masked Autoencoders Are Scalable Vision Learners
Reference 2021
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 6f7e5855-ea2d-4866-abef-f2ca3b8b97a4 · outbound
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders Flow Matching for Generative Modeling
Reference 2022
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 26b0d4e0-4b54-4a25-8570-7882cd0b2820 · outbound
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders PixArt-$\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis
Reference 2023
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9109bb9a-2641-4b02-b1c2-bdea3a36d576 · outbound
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders Scaling Rectified Flow Transformers for High-Resolution Image Synthesis
Reference 2024
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 38f8dc10-0612-4b39-8cff-48529173ae1b · outbound
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models
Reference 2025
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
No inbound Pith citation observations are available.