{"as_of":"2026-08-05T17:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ad8392637705d19f1460e8c484d5e382cd121f604035736e2eef32f5ca1d9185","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T23:11:58.580004Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.31590/citation-record","integrity":"/paper/2605.31590/integrity","json":"/paper/2605.31590/citation-record.json","paper":"/paper/2605.31590"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:cf3cfa6c7605d065b822663d1c38e34098ad5e7b6469453b49b7e7fea75736b6","observation_id":"76e9be83-1093-4ba6-8b1b-1331471cb602","resolution":{"observed_at":"2026-06-28T23:12:46.594052Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":"Ditctrl: Exploring attention control in multi-modal diffusion transformer for tuning-free multi-prompt longer video gen- eration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:d24ce0ea35ff8d215307c57c62bfc45d068c8f6781d5f30574a721352af4dce1","observation_id":"6203fcb5-ab24-4cf3-a47c-1cebb3ebf072","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":"Ditctrl: Exploring attention control in multi-modal diffusion transformer for tuning-free multi-prompt longer video gener- ation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:f5897f78b3ca7f5885ffb8b36b1650a75afea500244fa3e0eda81ab779a53e22","observation_id":"d906fdfe-4d9d-45bc-ab08-b0d23ac89454","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:2e23102a621c902c2a5debfccd1cb80c4d6dd407a28fdf3baa15d6d827f1145e","observation_id":"d66cb7dc-8fd3-409e-8000-5e30508060aa","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":"Training-free layout control with cross-attention guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:67cf1d20ee27e3c088aa84cf611be140ef3b7652a062baccc33dd4fbb8bcfd9e","observation_id":"b51b9e38-4e89-40b8-a1af-5a3718d22875","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":"Gentron: Diffusion transformers for image and video generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:4df646705a210f4f64a4f79610c4d5173e35e540f28a3b98f99827e32b038d5f","observation_id":"7d793ee3-ce5e-4d34-880d-8f05ac37538a","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2403.05131","doi":"10.48550/arxiv.2403.05131","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2403.05131 (2024)","venue":"arXiv (Cornell University)","work_id":"240fe91a-0dcf-46f6-a19e-9e416d5e9de8","year":2024},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:5f450effc59e70b39131a12ad461811d7d391876ae0835246fb2e09736308e44","observation_id":"af1d1ea9-6c2d-4183-b263-ee3a56eb75d0","resolution":{"observed_at":"2026-06-28T23:12:46.586477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":"Gemini 2.5: Pushing the frontier with advanced reason- ing, multimodality, long context, and next generation agentic capabilities, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:223741981299628aecf1a9b46626f30e575b2ad3104a533b71fe749e5e0c2c1b","observation_id":"a7f9ca58-707a-473f-b164-874037155d13","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.00983","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:54.342857Z","title":"Worldscore: A unified evaluation benchmark for world generation","venue":null,"work_id":"ad14fa35-72b1-4530-b01a-6d41cd35888d","year":2025},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:fdf49e3a825304a1dfdd470cb66fdb4c1de9e59baa2ee1578b750fbbfd2c3cfe","observation_id":"edb8bad0-c096-4c02-8693-3e28f47d70ea","resolution":{"observed_at":"2026-06-28T23:12:46.596243Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:442b7e14ff2b24947cc353d11b2cd90835005e4ef5764a01c5126b5b61b6332f","observation_id":"3a84c555-3e4e-45cc-8807-04266b9a91e6","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-07-06T13:15:58.303738Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":"2205.15868","doi":"10.48550/arxiv.2205.15868","metadata_source":"pith","pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","venue":"cs.CV","work_id":"2dbd6bcd-fc98-4fbf-b586-f6d94fe1abd2","year":2022},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:fc9f6d2411b0cc7141c589a57a0ab59909c90800062d7958935c8f3d99a9988b","observation_id":"6a691235-a635-4b97-bfc6-be22af53c68d","resolution":{"observed_at":"2026-06-28T23:12:46.583304Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":"Vbench: Compre- hensive benchmark suite for video generative models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:2e6e205e0b70db77a0a6f6a273619581d1c94e23083bec8f1d0fe7d17415bc2d","observation_id":"11862399-67f1-4211-9819-3e3d43bd61b1","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:1a54fb07e145e651e2d7d737bbb8c6ca927ea95c131e0d945eac72696bd30966","observation_id":"4b5af13c-43e8-453f-ae57-5aa4f38c006c","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":"Vbench++: Comprehensive and versatile benchmark suite for video generative models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:4d4abe3dd4e386df20e06322f343c28669c6e841853aca43b496ddb4fe71383b","observation_id":"765ac7fd-7f41-4451-9ee2-d308f73c225a","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":"Ultralytics yolo11, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:e5fdfd0104367dcf4f87ed3a5c52c4994330ad6c42130edb13707564ad3a7a73","observation_id":"07d0dd1e-57da-4b78-9f0b-8259decb59f9","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02385","last_updated":"2025-06-22T03:30:55Z","snapshot_observed_at":"2026-08-02T22:45:54.982294Z","submitted_at":"2024-11-04T18:53:05Z","title":"How Far is Video Generation from World Model: A Physical Law Perspective","version":2},"cited_work":{"arxiv_id":"2411.02385","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.02385","snapshot_observed_at":"2026-07-08T07:14:45.230404Z","title":"How Far is Video Generation from World Model: A Physical Law Perspective","venue":"cs.CV","work_id":"4459ec7e-7a67-4b25-9c04-e91d87bf1b63","year":2024},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"cited_paper":"/paper/2411.02385","citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:8409478f06c6f7f3b7e9f91625b91b0d01c8e82aabb2339afec13cbe101b1af2","observation_id":"ca0989ee-7986-43b7-afd5-4559bbd3073d","resolution":{"observed_at":"2026-06-28T23:12:46.591661Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":"Shotadapter: Text-to-multi- shot video generation with diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:d39a2103b094e19d460c9dc8c305b8a6530670d93c63e9957c18c189ffe777b2","observation_id":"54b066d2-8886-4daa-8188-e8604c52732a","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":"Fifo-diffusion: Generating infinite videos from text without training.Advances in Neural Information Processing Sys- tems, 37:89834–89868, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:94cd6b0d6a6ba58709e73c8ad5e0a745a3cd6660e4da003774eb53394882ad8b","observation_id":"88f5ef1e-8b26-4a05-96cc-bd7cf70ee4ee","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20694","last_updated":"2025-02-28T03:58:23Z","snapshot_observed_at":"2026-07-06T20:44:08.651242Z","submitted_at":"2025-02-28T03:58:23Z","title":"WorldModelBench: Judging Video Generation Models As World Models","version":1},"cited_work":{"arxiv_id":"2502.20694","doi":"10.48550/arxiv.2502.20694","metadata_source":"pith","pith_arxiv_id":"2502.20694","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, S., Wu, K., Zhang, C., and Zhu, Y","venue":"cs.CV","work_id":"33a5087c-1633-4d52-b891-f34d10b9e7c8","year":2025},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"cited_paper":"/paper/2502.20694","citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:1063b8e725e44e55d4c4b0c3542b80874d5a29bb7f6ab007b3905f704099b25d","observation_id":"c780c3ee-e856-491d-a579-0b1aa5b91ff0","resolution":{"observed_at":"2026-06-28T23:12:46.577767Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:51.214081+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:51.214081+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17459","last_updated":"2025-04-11T12:31:07Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:23:53Z","title":"WF-VAE: Enhancing Video VAE by Wavelet-Driven Energy Flow for Latent Video Diffusion Model","version":3},"cited_work":{"arxiv_id":"2411.17459","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.17459","snapshot_observed_at":"2026-06-28T23:12:46.604761Z","title":"Wf-vae: Enhancing video vae by wavelet-driven energy flow for latent video diffusion model","venue":null,"work_id":"c74a932f-ebe4-4f2b-bc0e-19df7d304c51","year":2024},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"cited_paper":"/paper/2411.17459","citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:8ae3f7e2efea56c1d81173c6296babf8e76ace435765008301bf934ad31f282f","observation_id":"05f890ee-2a95-4b28-86ee-f2fee442a67a","resolution":{"observed_at":"2026-06-28T23:12:46.606920Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":"2405.08748","doi":"10.48550/arxiv.2405.08748","metadata_source":"pith","pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","venue":"cs.CV","work_id":"fde63b0b-25e7-43d9-9867-7d6a2ba6d710","year":2024},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:ce662baabacdf1b451c43d66fbf56a7c4a1f284581d46b7e4a1c088eaf2f8306","observation_id":"dfe4843f-5617-403d-9aad-ce30152082b3","resolution":{"observed_at":"2026-06-28T23:12:46.593592Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":"Videoinsta: Zero-shot long video understanding via informative spatial- temporal reasoning with llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:e3099d38ac32a8bf39eae38b9691e4c0860047ae8d6d436d2444922cb6fbed6b","observation_id":"f0e805ef-54a3-4379-bebe-ef4974e53807","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":"Gentkg: Generative forecasting on temporal knowl- edge graph with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:2e51a8cb69aa2d48c0b6df0d4d8c94b8c223becba395fb5ebfebc454d2f82851","observation_id":"4bfb109e-91e9-485e-9ee6-7c1c3ce1ce81","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":"When and where do events switch in multi-event video generation?, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:29c57b1f96f4fe087703fc071487f44b3be0ad15d9eb4375afd8b01303e7477b","observation_id":"efa1e13c-f5a5-47af-8f0f-e4f841d6fa32","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"cited_work":{"arxiv_id":"2412.00131","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.00131","snapshot_observed_at":"2026-07-08T14:44:59.776032Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","venue":"cs.CV","work_id":"51c0ab25-66f7-4d1a-a028-86b9b1b9e313","year":2024},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"cited_paper":"/paper/2412.00131","citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:79715d235eaf93db318c3ae5d95c8913521ba2ed7de26514d06989a77754e105","observation_id":"103510e3-8a9d-4276-a83a-94fcbaeb3d46","resolution":{"observed_at":"2026-06-28T23:12:46.609111Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15720","last_updated":"2025-08-21T16:57:33Z","snapshot_observed_at":"2026-08-05T17:40:43.174414Z","submitted_at":"2025-08-21T16:57:33Z","title":"WorldWeaver: Generating Long-Horizon Video Worlds via Rich Perception","version":1},"cited_work":{"arxiv_id":"2508.15720","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.15720","snapshot_observed_at":"2026-07-03T14:28:32.182919Z","title":"arXiv preprint arXiv:2508.15720 , year=","venue":null,"work_id":"83fd282b-79f8-4859-912e-9f1a620322a8","year":2025},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"cited_paper":"/paper/2508.15720","citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:af1b28ab02e18130e44cd48595086eebdd4b4ba51b9d765154cddf2bd4fbd027","observation_id":"1ed6f011-4c01-4cd5-9f57-32d103dfb18b","resolution":{"observed_at":"2026-06-28T23:12:46.583846Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":"The shape variational autoencoder: A deep generative model of part- segmented 3d objects","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:0a6d952b61eb03ee3b84352cc7169933b223e574b14d2b98797a18a8ed2096d2","observation_id":"2946d51b-53f8-42b6-b0d1-87d41cca2d5b","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":"Mevg: Multi-event video generation with text-to-video models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:53dd601135855fd1b140a3cafbc64da04857916f3a0fa29be7f5feb6904abec6","observation_id":"710f9f24-21a5-480d-8620-2ab216540981","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":"Dinov2: Learning robust visual features without supervision, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:1378cdf6a490851a8f1946e5062bab8d46de79e51943e63b62390924688666d8","observation_id":"d6e3ae73-d0be-467e-9399-74ddc6fc4b33","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":"Scalable diffusion models with transformers, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:c136398ea2124cb322c8403d9579d5d11709d3db06151bd5db059b40f4d3c0db","observation_id":"52bacbbf-0c80-4848-b06d-17dd0bf0e361","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:8c0fdd751e68bce3c2e66da5d4924e78a4461cd6d6a669d13b3d496f135d546c","observation_id":"6c9afdd7-eae1-4c8f-8833-a4f50f5de467","resolution":{"observed_at":"2026-06-28T23:12:46.601451Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":"Maskˆ 2dit: Dual mask-based diffusion transformer for multi-scene long video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:76438a8bb4373a2d43679e294d0a8b01b0e5338098d96427684f8ecf26136ce0","observation_id":"36c43547-2fd7-4901-9b64-9422f20836ac","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":"Mask2dit: Dual mask-based diffusion transformer for multi-scene long video generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:208e903183dc06d3684a5f377303c94015d7e20d037b8161f37eb04adff71cc2","observation_id":"5a8f765a-cdf3-4b4a-81dc-82c23a4612f7","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":"Freenoise: Tuning-free longer video diffusion via noise rescheduling, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:bc0332d601d57b4c8c65d6272a21120d052202467144f576a2c0740f84970627","observation_id":"08d7fbad-a0db-4e59-8deb-80dfb991969a","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":"Learning transferable visual models from natural language supervision, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:82f09c77e78983d6e5cba398f02f314b136608a738000c0db56be38b655e3649","observation_id":"aceb53e7-9a54-4806-9764-686d6efe35e8","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":"Sam 2: Segment anything in images and videos, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:aa5ab612e5cfbf0a9d5fcd01ef085379c77f3d26c11402bff361d759cfadd33e","observation_id":"b179efed-ebcd-47df-9319-4be0b7ace8a5","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:3079dd6f6e48ea16639ba860b078de03fb1ef6ddf7ecb8d79bd782130c5e03ca","observation_id":"f77088c5-2ede-446d-8ef1-533c7849f217","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02265","last_updated":"2024-11-06T09:15:27Z","snapshot_observed_at":"2026-08-04T12:39:25.666793Z","submitted_at":"2024-11-04T16:56:26Z","title":"Hunyuan-Large: An Open-Source MoE Model with 52 Billion Activated Parameters by Tencent","version":3},"cited_work":{"arxiv_id":"2411.02265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02265","snapshot_observed_at":"2026-07-04T20:10:07.812289Z","title":"Hunyuan$large: An open$source moe model with 52 billion activated parameters by tencent","venue":null,"work_id":"05bfc742-1ecf-49a7-8616-8c7db577a7f5","year":2024},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"cited_paper":"/paper/2411.02265","citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:162cd8fdb650e4a4bc99c2d6b3b7cc518229e2c115fde3552492dfa8488e1af2","observation_id":"4aae7ec2-705b-461d-82a0-9946e25a089c","resolution":{"observed_at":"2026-06-28T23:12:46.602454Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":"Mochi 1.https://github.com/ genmoai/models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:32ca4eb35db53129042ff4227f434e22ec4f912f294cbd06a4d4ae1aa86e62a0","observation_id":"ea07cecb-0ba7-432c-b451-300646f8e850","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":"The tensor brain: A unified theory of perception, memory, and semantic decoding.Neu- ral Computation, 35(2):156–227, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:58b3063c4456308acae1c58bbfc1aed999261098ed4e9e66f49787bd9daee1ef","observation_id":"c0817d67-ba4d-4308-bdd9-13311526e164","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":"Wan: Open and advanced large-scale video gener- ative models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:a12bfd4fdc94dae7a2599b22c48e39b879e40f3200c09e34e3a3c8678e86726e","observation_id":"058e16f0-6d4c-47a7-bb77-7dc14683e4c3","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-07-06T15:34:51.593721Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":"2305.18264","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-07-01T13:45:45.958520Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising","venue":null,"work_id":"768486ef-2006-4563-9c70-5e08d8badf2a","year":2023},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:26497239ed6617006f4bb3e1b981b828adfcb5622355bec22a65be0bca7e226a","observation_id":"9b2d46f0-9827-4cb1-9f7a-9c650d46af2c","resolution":{"observed_at":"2026-06-28T23:12:46.608468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:85829783fc75abb0b333503f14bb5ce1278f2963b64be92a1e913be8c26a5191","observation_id":"5d81d4a1-cccb-442e-a445-82911ff79c1f","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:76db547b4d90d9115cdb79e90537ca08f4b1c53f90c242eb3aa367a82b97e0c3","observation_id":"9812266b-e47a-46e7-b7ba-f5981c6d82f3","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":"Mind the time: Temporally-controlled multi-event video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:545f153c6e67ee95f1d1871955641c526888c700564dadc422ab2f0691c0864c","observation_id":"49b15346-04e9-4de5-ba0f-0811e85e1e5c","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":"A survey on video diffusion models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:63098b9327175cb69601b5374e69b551cf205615bcc405403e93dcc3be5a9cd2","observation_id":"1ce5e9c2-80d1-4d58-84f8-94c3b40d366f","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":"Dynamic prompt learning: Addressing cross- attention leakage for text-based image editing.Advances in Neural Information Processing Systems, 36:26291–26303,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:b9e3de0528c31cc8f39c39e2b2f2bc4d423edd58ff587530a861167d5182ff98","observation_id":"398bc0c1-7a70-4f80-a3e8-ca4200f8a894","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":"2408.06072","doi":"10.48550/arxiv.2408.06072","metadata_source":"pith","pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","venue":"cs.CV","work_id":"f38fc088-12aa-4bf4-9ecd-08d3e797ccb7","year":2024},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:427d23b4f7bd1d8ac255eff393b2c0bbc83af39b7e0aeed874e9da7087e63a6c","observation_id":"deef2a6c-e11d-468c-968e-25a8d71a2339","resolution":{"observed_at":"2026-06-28T23:12:46.603741Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":"Instadrive: Instance-aware driving world models for realistic and consistent video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:72d4a56ae5b4d43228cb9dcd89e8ece55a405e4ead5c5702926452f6a810cfa8","observation_id":"60284256-0f1b-4488-ad4c-fa16fe09a7ca","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09645","last_updated":"2025-08-20T18:39:27Z","snapshot_observed_at":"2026-07-06T20:06:13.565435Z","submitted_at":"2024-12-10T18:52:39Z","title":"Evaluation Agent: Efficient and Promptable Evaluation Framework for Visual Generative Models","version":3},"cited_work":{"arxiv_id":"2412.09645","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09645","snapshot_observed_at":"2026-07-03T05:07:38.842004Z","title":"arXiv preprint arXiv:2412.09645 , year =","venue":null,"work_id":"c6095669-7de8-48cf-8ade-c967f0a2f115","year":2024},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"cited_paper":"/paper/2412.09645","citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:169bfab3ff69f5c8e66a8f4015aebbd45103c9941fbb3fd5db08e09fe8e0c7dd","observation_id":"9625d3ce-b586-4fa2-a39b-9289a657270d","resolution":{"observed_at":"2026-06-28T23:12:46.599104Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.14428","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:12:46.589792Z","title":"Magiccomp: Training-free dual-phase refinement for compositional video generation","venue":null,"work_id":"fe582a5a-8c85-4c97-b0e9-d0407e745bc5","year":2025},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:dcdf42c100db6fb3baa4b596281ee719dc3e94eca970f2bf0ab54e61b97af2b9","observation_id":"2a0daf92-4b15-4ffd-9ac8-0a55efa4008b","resolution":{"observed_at":"2026-06-28T23:12:46.591253Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":"Vbench-2.0: Advancing video generation benchmark suite for intrinsic faithfulness,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:f086be5d6151640d923d20c4ff29b54474fb7fb03624b070935c4b8e2165da29","observation_id":"eb376d5a-e557-4652-bfa1-cdf7be0c9a7b","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:7a8fab937d83dc73e664d774c77e4ee9171da3db1343592a97d8aa9bc6fa2a1d","observation_id":"e4d837c3-d93d-4010-bbf0-90d83ba5839e","resolution":{"observed_at":"2026-06-28T23:12:46.585772Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":"Figure 10","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:076bf4fe8aa122a3bf6ab826637d48ef23766b98fab926f8517a7688a0a404b9","observation_id":"6235ece4-5e82-4d51-b6f2-d3b9ca5d911e","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:664f8802e3db11c97b357b7bebac59fc8ec745e055c4fea730c449f1cae96413","observation_id":"e687d6ff-4959-4311-a7cc-fff26b7fe478","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:2213d3731aeeb0a76d80b9a587c09a804ba178185c408a961bdb4525929b6ce3","observation_id":"449ade3c-c51f-44b1-8b62-8659f9268fd1","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:11:58.580004Z","title":"TunerDiT achieves superior Text-Video Alignment scores compared to the base- line models, including open-source base models and zero- shot methods MEVG, DiTCtrl and FreeNoise","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:dbb08bce95e79ed74c5cf27b134e12f13d99f448a73225d418654ab6a3760bad","observation_id":"d9e9fd10-a838-4c3e-bcca-32d14d6c02aa","resolution":{"observed_at":"2026-06-28T23:11:58.580004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":40,"verified_exact":16,"verified_fuzzy":0},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2605.31590."}