Pith. sign in

Paper Citation Record · LEDGER

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation

As of 5 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2605.31590.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2605.31590 v1

Coverage vector

measured 57 of 57 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-06-28T23:11:58.580004Z

measured 57 of 57 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-05T06:32:48.257954+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

57 of 57 outbound references displayed

  • verified exact16
  • verified fuzzy0
  • unresolved40
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch1

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 76e9be83-1093-4ba6-8b1b-1331471cb602 · outbound

This paper cites eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers

Reference 1

Resolution
verified exact
local_arxiv, observed 2026-06-28T23:12:46.594052Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:cf3cfa6c7605d065b822663d1c38e34098ad5e7b6469453b49b7e7fea75736b6

Observation 6203fcb5-ab24-4cf3-a47c-1cebb3ebf072 · outbound

This paper cites Ditctrl: Exploring attention control in multi-modal diffusion transformer for tuning-free multi-prompt longer video gen- eration.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Ditctrl: Exploring attention control in multi-modal diffusion transformer for tuning-free multi-prompt longer video gen- eration

Reference 2

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:d24ce0ea35ff8d215307c57c62bfc45d068c8f6781d5f30574a721352af4dce1

Observation d906fdfe-4d9d-45bc-ab08-b0d23ac89454 · outbound

This paper cites Ditctrl: Exploring attention control in multi-modal diffusion transformer for tuning-free multi-prompt longer video gener- ation, 2025.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Ditctrl: Exploring attention control in multi-modal diffusion transformer for tuning-free multi-prompt longer video gener- ation, 2025

Reference 3

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:f5897f78b3ca7f5885ffb8b36b1650a75afea500244fa3e0eda81ab779a53e22

Observation d66cb7dc-8fd3-409e-8000-5e30508060aa · outbound

This paper cites Videocrafter2: Overcoming data limitations for high-quality video diffusion models.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Videocrafter2: Overcoming data limitations for high-quality video diffusion models

Reference 4

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:2e23102a621c902c2a5debfccd1cb80c4d6dd407a28fdf3baa15d6d827f1145e

Observation b51b9e38-4e89-40b8-a1af-5a3718d22875 · outbound

This paper cites Training-free layout control with cross-attention guidance.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Training-free layout control with cross-attention guidance

Reference 5

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:67cf1d20ee27e3c088aa84cf611be140ef3b7652a062baccc33dd4fbb8bcfd9e

Observation 7d793ee3-ce5e-4d34-880d-8f05ac37538a · outbound

This paper cites Gentron: Diffusion transformers for image and video generation, 2024.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Gentron: Diffusion transformers for image and video generation, 2024

Reference 6

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:4df646705a210f4f64a4f79610c4d5173e35e540f28a3b98f99827e32b038d5f

Observation af1d1ea9-6c2d-4183-b263-ee3a56eb75d0 · outbound

This paper cites arXiv preprint arXiv:2403.05131 (2024).

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation arXiv preprint arXiv:2403.05131 (2024)

Reference 7

Resolution
verified exact
arxiv_id, observed 2026-06-28T23:12:46.586477Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:5f450effc59e70b39131a12ad461811d7d391876ae0835246fb2e09736308e44

Observation a7f9ca58-707a-473f-b164-874037155d13 · outbound

This paper cites Gemini 2.5: Pushing the frontier with advanced reason- ing, multimodality, long context, and next generation agentic capabilities, 2025.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Gemini 2.5: Pushing the frontier with advanced reason- ing, multimodality, long context, and next generation agentic capabilities, 2025

Reference 8

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:223741981299628aecf1a9b46626f30e575b2ad3104a533b71fe749e5e0c2c1b

Observation edb8bad0-c096-4c02-8693-3e28f47d70ea · outbound

This paper cites Worldscore: A unified evaluation benchmark for world generation.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Worldscore: A unified evaluation benchmark for world generation

Reference 9

Resolution
verified exact
arxiv_id, observed 2026-06-28T23:12:46.596243Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:fdf49e3a825304a1dfdd470cb66fdb4c1de9e59baa2ee1578b750fbbfd2c3cfe

Observation 3a84c555-3e4e-45cc-8807-04266b9a91e6 · outbound

This paper cites an unresolved cited work.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Unresolved cited work

Reference 10

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:442b7e14ff2b24947cc353d11b2cd90835005e4ef5764a01c5126b5b61b6332f

Observation 6a691235-a635-4b97-bfc6-be22af53c68d · outbound

This paper cites CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers

Reference 11

Resolution
verified exact
local_arxiv, observed 2026-06-28T23:12:46.583304Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:fc9f6d2411b0cc7141c589a57a0ab59909c90800062d7958935c8f3d99a9988b

Observation 11862399-67f1-4211-9819-3e3d43bd61b1 · outbound

This paper cites Vbench: Compre- hensive benchmark suite for video generative models, 2023.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Vbench: Compre- hensive benchmark suite for video generative models, 2023

Reference 12

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:2e6e205e0b70db77a0a6f6a273619581d1c94e23083bec8f1d0fe7d17415bc2d

Observation 4b5af13c-43e8-453f-ae57-5aa4f38c006c · outbound

This paper cites Vbench: Comprehensive benchmark suite for video generative models.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Vbench: Comprehensive benchmark suite for video generative models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:1a54fb07e145e651e2d7d737bbb8c6ca927ea95c131e0d945eac72696bd30966

Observation 765ac7fd-7f41-4451-9ee2-d308f73c225a · outbound

This paper cites Vbench++: Comprehensive and versatile benchmark suite for video generative models, 2024.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Vbench++: Comprehensive and versatile benchmark suite for video generative models, 2024

Reference 14

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:4d4abe3dd4e386df20e06322f343c28669c6e841853aca43b496ddb4fe71383b

Observation 07d0dd1e-57da-4b78-9f0b-8259decb59f9 · outbound

This paper cites Ultralytics yolo11, 2024.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Ultralytics yolo11, 2024

Reference 15

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:e5fdfd0104367dcf4f87ed3a5c52c4994330ad6c42130edb13707564ad3a7a73

Observation ca0989ee-7986-43b7-afd5-4559bbd3073d · outbound

This paper cites How Far is Video Generation from World Model: A Physical Law Perspective.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation How Far is Video Generation from World Model: A Physical Law Perspective

Reference 16

Resolution
verified exact
local_arxiv, observed 2026-06-28T23:12:46.591661Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:8409478f06c6f7f3b7e9f91625b91b0d01c8e82aabb2339afec13cbe101b1af2

Observation 54b066d2-8886-4daa-8188-e8604c52732a · outbound

This paper cites Shotadapter: Text-to-multi- shot video generation with diffusion models.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Shotadapter: Text-to-multi- shot video generation with diffusion models

Reference 17

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:d39a2103b094e19d460c9dc8c305b8a6530670d93c63e9957c18c189ffe777b2

Observation 88f5ef1e-8b26-4a05-96cc-bd7cf70ee4ee · outbound

This paper cites Fifo-diffusion: Generating infinite videos from text without training.Advances in Neural Information Processing Sys- tems, 37:89834–89868, 2024.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Fifo-diffusion: Generating infinite videos from text without training.Advances in Neural Information Processing Sys- tems, 37:89834–89868, 2024

Reference 18

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:94cd6b0d6a6ba58709e73c8ad5e0a745a3cd6660e4da003774eb53394882ad8b

Observation c780c3ee-e856-491d-a579-0b1aa5b91ff0 · outbound

This paper cites WorldModelBench: Judging Video Generation Models As World Models.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation WorldModelBench: Judging Video Generation Models As World Models

Reference 19

Resolution
metadata mismatch
arxiv_id, observed 2026-06-28T23:12:46.577767Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:1063b8e725e44e55d4c4b0c3542b80874d5a29bb7f6ab007b3905f704099b25d

Observation 05f890ee-2a95-4b28-86ee-f2fee442a67a · outbound

This paper cites WF-VAE: Enhancing Video VAE by Wavelet-Driven Energy Flow for Latent Video Diffusion Model.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation WF-VAE: Enhancing Video VAE by Wavelet-Driven Energy Flow for Latent Video Diffusion Model

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-06-28T23:12:46.606920Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:8ae3f7e2efea56c1d81173c6296babf8e76ace435765008301bf934ad31f282f

Observation dfe4843f-5617-403d-9aad-ce30152082b3 · outbound

This paper cites Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding

Reference 21

Resolution
verified exact
local_arxiv, observed 2026-06-28T23:12:46.593592Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:ce662baabacdf1b451c43d66fbf56a7c4a1f284581d46b7e4a1c088eaf2f8306

Observation f0e805ef-54a3-4379-bebe-ef4974e53807 · outbound

This paper cites Videoinsta: Zero-shot long video understanding via informative spatial- temporal reasoning with llms.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Videoinsta: Zero-shot long video understanding via informative spatial- temporal reasoning with llms

Reference 22

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:e3099d38ac32a8bf39eae38b9691e4c0860047ae8d6d436d2444922cb6fbed6b

Observation 4bfb109e-91e9-485e-9ee6-7c1c3ce1ce81 · outbound

This paper cites Gentkg: Generative forecasting on temporal knowl- edge graph with large language models.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Gentkg: Generative forecasting on temporal knowl- edge graph with large language models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:2e51a8cb69aa2d48c0b6df0d4d8c94b8c223becba395fb5ebfebc454d2f82851

Observation efa1e13c-f5a5-47af-8f0f-e4f841d6fa32 · outbound

This paper cites When and where do events switch in multi-event video generation?, 2025.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation When and where do events switch in multi-event video generation?, 2025

Reference 24

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:29c57b1f96f4fe087703fc071487f44b3be0ad15d9eb4375afd8b01303e7477b

Observation 103510e3-8a9d-4276-a83a-94fcbaeb3d46 · outbound

This paper cites Open-Sora Plan: Open-Source Large Video Generation Model.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Open-Sora Plan: Open-Source Large Video Generation Model

Reference 25

Resolution
verified exact
local_arxiv, observed 2026-06-28T23:12:46.609111Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:79715d235eaf93db318c3ae5d95c8913521ba2ed7de26514d06989a77754e105

Observation 1ed6f011-4c01-4cd5-9f57-32d103dfb18b · outbound

This paper cites WorldWeaver: Generating Long-Horizon Video Worlds via Rich Perception.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation WorldWeaver: Generating Long-Horizon Video Worlds via Rich Perception

Reference 26

Resolution
verified exact
arxiv_id, observed 2026-06-28T23:12:46.583846Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:9848f6a902c75bb645aa9a417a72d95b9ea489a49e003905b2b2a112e7f830e6

Observation 2946d51b-53f8-42b6-b0d1-87d41cca2d5b · outbound

This paper cites The shape variational autoencoder: A deep generative model of part- segmented 3d objects.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation The shape variational autoencoder: A deep generative model of part- segmented 3d objects

Reference 27

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:0a6d952b61eb03ee3b84352cc7169933b223e574b14d2b98797a18a8ed2096d2

Observation 710f9f24-21a5-480d-8620-2ab216540981 · outbound

This paper cites Mevg: Multi-event video generation with text-to-video models.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Mevg: Multi-event video generation with text-to-video models

Reference 28

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:53dd601135855fd1b140a3cafbc64da04857916f3a0fa29be7f5feb6904abec6

Observation d6e3ae73-d0be-467e-9399-74ddc6fc4b33 · outbound

This paper cites Dinov2: Learning robust visual features without supervision, 2024.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Dinov2: Learning robust visual features without supervision, 2024

Reference 29

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:1378cdf6a490851a8f1946e5062bab8d46de79e51943e63b62390924688666d8

Observation 52bacbbf-0c80-4848-b06d-17dd0bf0e361 · outbound

This paper cites Scalable diffusion models with transformers, 2023.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Scalable diffusion models with transformers, 2023

Reference 30

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:c136398ea2124cb322c8403d9579d5d11709d3db06151bd5db059b40f4d3c0db

Observation 6c9afdd7-eae1-4c8f-8833-a4f50f5de467 · outbound

This paper cites Movie Gen: A Cast of Media Foundation Models.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Movie Gen: A Cast of Media Foundation Models

Reference 31

Resolution
verified exact
local_arxiv, observed 2026-06-28T23:12:46.601451Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:8c0fdd751e68bce3c2e66da5d4924e78a4461cd6d6a669d13b3d496f135d546c

Observation 36c43547-2fd7-4901-9b64-9422f20836ac · outbound

This paper cites Maskˆ 2dit: Dual mask-based diffusion transformer for multi-scene long video generation.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Maskˆ 2dit: Dual mask-based diffusion transformer for multi-scene long video generation

Reference 32

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:76438a8bb4373a2d43679e294d0a8b01b0e5338098d96427684f8ecf26136ce0

Observation 5a8f765a-cdf3-4b4a-81dc-82c23a4612f7 · outbound

This paper cites Mask2dit: Dual mask-based diffusion transformer for multi-scene long video generation, 2025.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Mask2dit: Dual mask-based diffusion transformer for multi-scene long video generation, 2025

Reference 33

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:208e903183dc06d3684a5f377303c94015d7e20d037b8161f37eb04adff71cc2

Observation 08d7fbad-a0db-4e59-8deb-80dfb991969a · outbound

This paper cites Freenoise: Tuning-free longer video diffusion via noise rescheduling, 2024.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Freenoise: Tuning-free longer video diffusion via noise rescheduling, 2024

Reference 34

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:bc0332d601d57b4c8c65d6272a21120d052202467144f576a2c0740f84970627

Observation aceb53e7-9a54-4806-9764-686d6efe35e8 · outbound

This paper cites Learning transferable visual models from natural language supervision, 2021.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Learning transferable visual models from natural language supervision, 2021

Reference 35

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:82f09c77e78983d6e5cba398f02f314b136608a738000c0db56be38b655e3649

Observation b179efed-ebcd-47df-9319-4be0b7ace8a5 · outbound

This paper cites Sam 2: Segment anything in images and videos, 2024.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Sam 2: Segment anything in images and videos, 2024

Reference 36

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:aa5ab612e5cfbf0a9d5fcd01ef085379c77f3d26c11402bff361d759cfadd33e

Observation f77088c5-2ede-446d-8ef1-533c7849f217 · outbound

This paper cites Sentence-bert: Sentence embeddings using siamese bert-networks.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Sentence-bert: Sentence embeddings using siamese bert-networks

Reference 37

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:3079dd6f6e48ea16639ba860b078de03fb1ef6ddf7ecb8d79bd782130c5e03ca

Observation 4aae7ec2-705b-461d-82a0-9946e25a089c · outbound

This paper cites Hunyuan-Large: An Open-Source MoE Model with 52 Billion Activated Parameters by Tencent.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Hunyuan-Large: An Open-Source MoE Model with 52 Billion Activated Parameters by Tencent

Reference 38

Resolution
verified exact
arxiv_id, observed 2026-06-28T23:12:46.602454Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:162cd8fdb650e4a4bc99c2d6b3b7cc518229e2c115fde3552492dfa8488e1af2

Observation ea07cecb-0ba7-432c-b451-300646f8e850 · outbound

This paper cites Mochi 1.https://github.com/ genmoai/models, 2024.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Mochi 1.https://github.com/ genmoai/models, 2024

Reference 39

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:32ca4eb35db53129042ff4227f434e22ec4f912f294cbd06a4d4ae1aa86e62a0

Observation c0817d67-ba4d-4308-bdd9-13311526e164 · outbound

This paper cites The tensor brain: A unified theory of perception, memory, and semantic decoding.Neu- ral Computation, 35(2):156–227, 2023.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation The tensor brain: A unified theory of perception, memory, and semantic decoding.Neu- ral Computation, 35(2):156–227, 2023

Reference 40

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:58b3063c4456308acae1c58bbfc1aed999261098ed4e9e66f49787bd9daee1ef

Observation 058e16f0-6d4c-47a7-bb77-7dc14683e4c3 · outbound

This paper cites Wan: Open and advanced large-scale video gener- ative models.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Wan: Open and advanced large-scale video gener- ative models

Reference 41

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:a12bfd4fdc94dae7a2599b22c48e39b879e40f3200c09e34e3a3c8678e86726e

Observation 9b2d46f0-9827-4cb1-9f7a-9c650d46af2c · outbound

This paper cites Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising

Reference 42

Resolution
verified exact
arxiv_id, observed 2026-06-28T23:12:46.608468Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:26497239ed6617006f4bb3e1b981b828adfcb5622355bec22a65be0bca7e226a

Observation 5d81d4a1-cccb-442e-a445-82911ff79c1f · outbound

This paper cites Gen-l-video: Multi-text to long video generation via temporal co-denoising, 2023.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Gen-l-video: Multi-text to long video generation via temporal co-denoising, 2023

Reference 43

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:85829783fc75abb0b333503f14bb5ce1278f2963b64be92a1e913be8c26a5191

Observation 9812266b-e47a-46e7-b7ba-f5981c6d82f3 · outbound

This paper cites Internvid: A large-scale video-text dataset for multimodal understanding and generation, 2024.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Internvid: A large-scale video-text dataset for multimodal understanding and generation, 2024

Reference 44

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:76db547b4d90d9115cdb79e90537ca08f4b1c53f90c242eb3aa367a82b97e0c3

Observation 49b15346-04e9-4de5-ba0f-0811e85e1e5c · outbound

This paper cites Mind the time: Temporally-controlled multi-event video generation.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Mind the time: Temporally-controlled multi-event video generation

Reference 45

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:545f153c6e67ee95f1d1871955641c526888c700564dadc422ab2f0691c0864c

Observation 1ce5e9c2-80d1-4d58-84f8-94c3b40d366f · outbound

This paper cites A survey on video diffusion models, 2024.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation A survey on video diffusion models, 2024

Reference 46

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:63098b9327175cb69601b5374e69b551cf205615bcc405403e93dcc3be5a9cd2

Observation 398bc0c1-7a70-4f80-a3e8-ca4200f8a894 · outbound

This paper cites Dynamic prompt learning: Addressing cross- attention leakage for text-based image editing.Advances in Neural Information Processing Systems, 36:26291–26303,.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Dynamic prompt learning: Addressing cross- attention leakage for text-based image editing.Advances in Neural Information Processing Systems, 36:26291–26303,

Reference 47

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:b9e3de0528c31cc8f39c39e2b2f2bc4d423edd58ff587530a861167d5182ff98

Observation deef2a6c-e11d-468c-968e-25a8d71a2339 · outbound

This paper cites CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer

Reference 48

Resolution
verified exact
local_arxiv, observed 2026-06-28T23:12:46.603741Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:427d23b4f7bd1d8ac255eff393b2c0bbc83af39b7e0aeed874e9da7087e63a6c

Observation 60284256-0f1b-4488-ad4c-fa16fe09a7ca · outbound

This paper cites Instadrive: Instance-aware driving world models for realistic and consistent video generation.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Instadrive: Instance-aware driving world models for realistic and consistent video generation

Reference 49

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:72d4a56ae5b4d43228cb9dcd89e8ece55a405e4ead5c5702926452f6a810cfa8

Observation 9625d3ce-b586-4fa2-a39b-9289a657270d · outbound

This paper cites Evaluation Agent: Efficient and Promptable Evaluation Framework for Visual Generative Models.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Evaluation Agent: Efficient and Promptable Evaluation Framework for Visual Generative Models

Reference 50

Resolution
verified exact
arxiv_id, observed 2026-06-28T23:12:46.599104Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:169bfab3ff69f5c8e66a8f4015aebbd45103c9941fbb3fd5db08e09fe8e0c7dd

Observation 2a0daf92-4b15-4ffd-9ac8-0a55efa4008b · outbound

This paper cites Magiccomp: Training-free dual-phase refinement for compositional video generation.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Magiccomp: Training-free dual-phase refinement for compositional video generation

Reference 51

Resolution
verified exact
arxiv_id, observed 2026-06-28T23:12:46.591253Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:dcdf42c100db6fb3baa4b596281ee719dc3e94eca970f2bf0ab54e61b97af2b9

Observation eb376d5a-e557-4652-bfa1-cdf7be0c9a7b · outbound

This paper cites Vbench-2.0: Advancing video generation benchmark suite for intrinsic faithfulness,.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Vbench-2.0: Advancing video generation benchmark suite for intrinsic faithfulness,

Reference 52

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:f086be5d6151640d923d20c4ff29b54474fb7fb03624b070935c4b8e2165da29

Observation e4d837c3-d93d-4010-bbf0-90d83ba5839e · outbound

This paper cites VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness

Reference 53

Resolution
verified exact
local_arxiv, observed 2026-06-28T23:12:46.585772Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:7a8fab937d83dc73e664d774c77e4ee9171da3db1343592a97d8aa9bc6fa2a1d

Observation 6235ece4-5e82-4d51-b6f2-d3b9ca5d911e · outbound

This paper cites Figure 10.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Figure 10

Reference 54

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:076bf4fe8aa122a3bf6ab826637d48ef23766b98fab926f8517a7688a0a404b9

Observation e687d6ff-4959-4311-a7cc-fff26b7fe478 · outbound

This paper cites an unresolved cited work.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Unresolved cited work

Reference 55

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:664f8802e3db11c97b357b7bebac59fc8ec745e055c4fea730c449f1cae96413

Observation 449ade3c-c51f-44b1-8b62-8659f9268fd1 · outbound

This paper cites an unresolved cited work.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Unresolved cited work

Reference 56

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:2213d3731aeeb0a76d80b9a587c09a804ba178185c408a961bdb4525929b6ce3

Observation d9e9fd10-a838-4c3e-bcca-32d14d6c02aa · outbound

This paper cites TunerDiT achieves superior Text-Video Alignment scores compared to the base- line models, including open-source base models and zero- shot methods MEVG, DiTCtrl and FreeNoise.

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation TunerDiT achieves superior Text-Video Alignment scores compared to the base- line models, including open-source base models and zero- shot methods MEVG, DiTCtrl and FreeNoise

Reference 57

Resolution
unresolved
no resolver link, observed 2026-06-28T23:11:58.580004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T23:11:58.580004Z digest=sha256:dbb08bce95e79ed74c5cf27b134e12f13d99f448a73225d418654ab6a3760bad

Pith citing papers

No inbound Pith citation observations are available.