{"as_of":"2026-08-22T10:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1d8db34c8bd7dde091e1a43e893a39cfa73bd901b27db7c764c618ac6146f8d6","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T18:58:11.054269Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.09547/citation-record","integrity":"/paper/2509.09547/integrity","json":"/paper/2509.09547/citation-record.json","paper":"/paper/2509.09547"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-15T10:28:42.385124Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04896","snapshot_observed_at":"2026-08-04T18:58:10.893526Z","title":"arXiv preprint arXiv:2502.04896","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:10.893526Z"},"links":{"cited_paper":"/paper/2502.04896","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:e2f7fd7283067f5ba6fdb3cb63bf83231cdde248a370367b217b246ab06de450","observation_id":"26eb7b67-5785-468d-ba32-3b6f849bf9e8","resolution":{"observed_at":"2026-08-04T18:58:10.893526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:58:11.054269Z","title":"Motivated by this trend, we also analyzed the vision encoder used in a state-of-the-art MLLM to better understand its po- tential for video generation tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:11.054269Z"},"links":{"citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:127e9ebbfd20f67d8156be5c302a2d70bc275d8ec16238b0f3027f36547ba0ba","observation_id":"0ed44e74-360b-4127-8c72-81f4380afe1a","resolution":{"observed_at":"2026-08-04T18:58:11.054269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10373","last_updated":"2023-11-20T10:54:09Z","snapshot_observed_at":"2026-08-15T03:17:05.670808Z","submitted_at":"2023-07-19T18:00:03Z","title":"TokenFlow: Consistent Diffusion Features for Consistent Video Editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10373","snapshot_observed_at":"2026-08-04T18:58:10.903298Z","title":"arXiv preprint arxiv:2307.10373","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:10.903298Z"},"links":{"cited_paper":"/paper/2307.10373","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:934a75dec4553faca8be7ee673d2699379caf6041640832c8c8e4a393b2649f2","observation_id":"7a6f59ae-cc4d-443a-b019-bf176068a81e","resolution":{"observed_at":"2026-08-04T18:58:10.903298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-08-17T14:04:31.230742Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-04T18:58:10.908196Z","title":"arXiv preprint arXiv:2307.04725","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:10.908196Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:eb2c2d8711bcf9854467d061292daa68deedca6bb34a71aab1a2cb4b4abf07d8","observation_id":"c02f7f1d-9315-4a20-8b56-bd70303c5a9e","resolution":{"observed_at":"2026-08-04T18:58:10.908196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-08-04T18:58:10.913793Z","title":"arXiv preprint arXiv:2501.00103","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:10.913793Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:7f6a7c2584c2f0a17dc9ce248c19fe1f296a27762ed88972565f3ab39fa2cbb9","observation_id":"f57d9569-41e4-4ca2-835d-ddd1a8fb5616","resolution":{"observed_at":"2026-08-04T18:58:10.913793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01409","last_updated":"2025-03-26T20:53:45Z","snapshot_observed_at":"2026-08-12T02:45:53.151105Z","submitted_at":"2025-01-02T18:55:04Z","title":"JOG3R: Towards 3D-Consistent Video Generators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01409","snapshot_observed_at":"2026-08-04T18:58:10.926506Z","title":"arXiv preprint arXiv:2501.01409","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:10.926506Z"},"links":{"cited_paper":"/paper/2501.01409","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:986c5bf4ec296238e29d4a55bd2d5076fd7d3ff265c5e041e1eeefd76faad5e7","observation_id":"c6d61e40-6b87-49a5-8bfd-613e72c48ce7","resolution":{"observed_at":"2026-08-04T18:58:10.926506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06016","last_updated":"2025-04-07T11:16:47Z","snapshot_observed_at":"2026-08-11T20:03:50.332267Z","submitted_at":"2024-12-08T18:21:00Z","title":"Track4Gen: Teaching Video Diffusion Models to Track Points Improves Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06016","snapshot_observed_at":"2026-08-04T18:58:10.931053Z","title":"arXiv preprint arXiv:2412.06016","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:10.931053Z"},"links":{"cited_paper":"/paper/2412.06016","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:e3b741f6b9faad332cc6263c7eee7dbeddea29168d24194453e995ea8da5fa8a","observation_id":"7efd77b1-8cd2-4244-8b9d-ae20be33c484","resolution":{"observed_at":"2026-08-04T18:58:10.931053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12218","last_updated":"2025-04-20T14:33:55Z","snapshot_observed_at":"2026-08-14T13:31:51.787116Z","submitted_at":"2025-01-21T15:39:40Z","title":"Exploring Temporally-Aware Features for Point Tracking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12218","snapshot_observed_at":"2026-08-04T18:58:10.935188Z","title":"arXiv preprint arXiv:2501.12218","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:10.935188Z"},"links":{"cited_paper":"/paper/2501.12218","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:92b0dcec2f408bcaad9878ff2d7d539ddf7be10c1f5d1589461a5618a970fc72","observation_id":"b4590f58-eee7-4510-981c-5546c821b0ba","resolution":{"observed_at":"2026-08-04T18:58:10.935188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-17T07:44:10.213698Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-04T18:58:10.939891Z","title":"arXiv preprint arXiv:2412.03603","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:10.939891Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:4cd1edbac1da98871aec6f8ac05c6b63d9aa230191c2d33da57dee582883cef9","observation_id":"a74e50d2-734c-49bc-bfd3-f7faa0312de4","resolution":{"observed_at":"2026-08-04T18:58:10.939891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-04T18:58:10.948812Z","title":"arXiv preprint arXiv:2209.03003","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:10.948812Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:2cae23a9d2678218236a61080d1b86f65e3ec6249eca9f176279d04059176ee6","observation_id":"cb39bf73-02a7-4928-9c5d-776b76021199","resolution":{"observed_at":"2026-08-04T18:58:10.948812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-04T18:58:10.953460Z","title":"arXiv:2502.10248","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:10.953460Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:1d3374cabc35dcbe6193ac206c71f530d6969d95fa5acfd6d46f8d689d5c495d","observation_id":"70974366-1796-44bb-9adf-73557c0f3467","resolution":{"observed_at":"2026-08-04T18:58:10.953460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-21T21:36:12.450915Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-08-04T18:58:10.957915Z","title":"arXiv preprint arXiv:2401.03048","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:10.957915Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:2500ee65718de71d9090e79666ba61653c273e5019b520965226741372ac7292","observation_id":"20fbdfa8-1737-4a96-a3c7-1e36bb9987ea","resolution":{"observed_at":"2026-08-04T18:58:10.957915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-07T10:03:56.902190Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-08-04T18:58:10.962343Z","title":"Oquab, M.; Darcet, T.; Moutakanni, T.; V o, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:10.962343Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:a01df38a5342439cab6cfe02e5b40dedd917a587dd150475dd818512e4687c98","observation_id":"dab65f3f-0119-4ca4-8306-636dee8c7695","resolution":{"observed_at":"2026-08-04T18:58:10.962343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-04T18:58:10.967014Z","title":"arXiv preprint arXiv:2307.01952","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:10.967014Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:4c1caab49ae4562dda43b676b418592238d66f2dd4d72307646b759d516e0bba","observation_id":"a84fc41f-d59e-4365-91d8-4c89d2d02fec","resolution":{"observed_at":"2026-08-04T18:58:10.967014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-17T10:09:03.767186Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-04T18:58:10.972403Z","title":"arXiv:2410.13720","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:10.972403Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:b1ca2dcf157b14bad4c970e7373ccd9907d6c74bb4f5631db5b5519ffdec6a1e","observation_id":"ed61d7da-adb1-4e8f-bfea-3a36ff56f536","resolution":{"observed_at":"2026-08-04T18:58:10.972403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-04T18:58:10.976812Z","title":"arXiv preprint arXiv:2408.00714","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:10.976812Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:5d462afbd42deb36512dec61d1af18a2c4174b82ea4534cc2d87a01ef7996ea4","observation_id":"0cd651a4-d122-43a5-9c68-3bcabeb37969","resolution":{"observed_at":"2026-08-04T18:58:10.976812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.09179","last_updated":"2018-03-24T23:12:44Z","snapshot_observed_at":"2026-08-20T08:15:34.075727Z","submitted_at":"2018-03-24T23:12:44Z","title":"FaceForensics: A Large-scale Video Dataset for Forgery Detection in Human Faces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.09179","snapshot_observed_at":"2026-08-04T18:58:10.981630Z","title":"R¨ossler, A.; Cozzolino, D.; Verdoliva, L.; Riess, C.; Thies, J.; and Nießner, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:10.981630Z"},"links":{"cited_paper":"/paper/1803.09179","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:04f25b25115fafd7b053cf4f5353a1c72686dd28f5fe9f3ec0fb6c014af4ee6b","observation_id":"a14a2fc1-8be7-4e86-8bcf-a24956c4e526","resolution":{"observed_at":"2026-08-04T18:58:10.981630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-04T18:58:10.986770Z","title":"arXiv preprint arXiv:2209.14792","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:10.986770Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:f1cdbacb0d00d83d8b814f105689f0445ece11e04b791c0bde247bc9fb95d039","observation_id":"e850c45d-85ec-453b-9861-d6de8c5f9c97","resolution":{"observed_at":"2026-08-04T18:58:10.986770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:58:11.000548Z","title":"arXiv:2502.06755","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:11.000548Z"},"links":{"citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:b006d6c5408311c5f0bf2a9d5fe5c55fa2a0c7ef905b9bc62b3f32327673577c","observation_id":"023655bb-12a9-472c-b6ef-6cfd1a033d53","resolution":{"observed_at":"2026-08-04T18:58:11.000548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14132","last_updated":"2024-12-02T13:00:56Z","snapshot_observed_at":"2026-08-16T14:32:27.907006Z","submitted_at":"2023-12-21T18:52:14Z","title":"DUSt3R: Geometric 3D Vision Made Easy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14132","snapshot_observed_at":"2026-08-04T18:58:11.013763Z","title":"arXiv:2312.14132","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:11.013763Z"},"links":{"cited_paper":"/paper/2312.14132","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:5dd1e97d9c462fc1286f08f70cd002fbf07d00189b476df456e22b7606082e48","observation_id":"32143b16-82f4-4cd2-955b-d7be0b1c4bfa","resolution":{"observed_at":"2026-08-04T18:58:11.013763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-04T18:58:11.018159Z","title":"arXiv preprint arXiv:2307.06942","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:11.018159Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:e1c1936232eb30c6224b8eda617236b17fb4cbf41451db2b4b172c65552f23fe","observation_id":"4474b6c3-8f6c-4003-add1-d6376784c4be","resolution":{"observed_at":"2026-08-04T18:58:11.018159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-04T18:58:11.022411Z","title":"arXiv preprint arXiv:2408.06072","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:11.022411Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:5f2e4e4879c44c1f3e2973683e5c617dac5804c85f2f37fbbe1764ef39d8d6c7","observation_id":"0caf6e20-38e6-4699-8cc2-643cf12b1d78","resolution":{"observed_at":"2026-08-04T18:58:11.022411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06940","last_updated":"2025-06-18T04:35:42Z","snapshot_observed_at":"2026-07-06T19:30:26.233621Z","submitted_at":"2024-10-09T14:34:53Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06940","snapshot_observed_at":"2026-08-04T18:58:11.026989Z","title":"arXiv preprint arXiv:2410.06940","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:11.026989Z"},"links":{"cited_paper":"/paper/2410.06940","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:6d477d9715066cc6577635ebdb89aab0f87e285f60aad19ce1ed35d829a1e2a1","observation_id":"0ee73c7b-dd24-4c7e-af27-0e254d57ea36","resolution":{"observed_at":"2026-08-04T18:58:11.026989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03825","last_updated":"2025-05-08T08:32:16Z","snapshot_observed_at":"2026-07-06T19:28:08.374354Z","submitted_at":"2024-10-04T18:00:07Z","title":"MonST3R: A Simple Approach for Estimating Geometry in the Presence of Motion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03825","snapshot_observed_at":"2026-08-04T18:58:11.031336Z","title":"arXiv preprint arxiv:2410.03825","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:11.031336Z"},"links":{"cited_paper":"/paper/2410.03825","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:1ee0dda4ac25c41f0c2238bf75ab3dac035617d9b3180018aeec42e9bf0c8174","observation_id":"acaa8341-38dc-40b5-9112-76a1cd7fe508","resolution":{"observed_at":"2026-08-04T18:58:11.031336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15458","last_updated":"2024-10-20T17:51:35Z","snapshot_observed_at":"2026-08-21T21:24:01.429930Z","submitted_at":"2024-10-20T17:51:35Z","title":"Allegro: Open the Black Box of Commercial-Level Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15458","snapshot_observed_at":"2026-08-04T18:58:11.035409Z","title":"arXiv preprint arXiv:2410.15458","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:11.035409Z"},"links":{"cited_paper":"/paper/2410.15458","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:a08575b8ab7257f09da5442cca4e08803e665e1a6cf61b2749a4a2a0f5017b1d","observation_id":"30b5a8eb-6250-443c-88e6-b9ba1b99d06c","resolution":{"observed_at":"2026-08-04T18:58:11.035409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:58:11.040371Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:11.040371Z"},"links":{"citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:5740a87c188b7eed380d7307994121fced6897a78b2ffd42f3c5b28bb1abc025","observation_id":"e0e99ed2-34da-4416-a43f-9e67902b292c","resolution":{"observed_at":"2026-08-04T18:58:11.040371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:58:11.044648Z","title":"We follow the same protocol as SkyTimeLapse, using the training split for both model training and metric evaluations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:11.044648Z"},"links":{"citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:9b7f59bc679f9a4934f090a60628509301516062350b009c45ee34cb49202eee","observation_id":"d80ade39-1e31-4951-a917-832cf523219c","resolution":{"observed_at":"2026-08-04T18:58:11.044648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:58:11.049572Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:11.049572Z"},"links":{"citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:53f1e52f88cbf955c5a23b81668b547e41be5b373a3a78160e02d7d1b435c519","observation_id":"b42b5a19-1675-4d4e-b843-4317b198fca6","resolution":{"observed_at":"2026-08-04T18:58:11.049572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-16T21:21:44.768787Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-04T18:58:10.996179Z","title":"arXiv:1212.0402","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:10.996179Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:9c8f8a1d14df91ebba9627af06abde17885db63a6a013c753a0e5e604f4392b1","observation_id":"efe36236-3ec3-44db-89c3-4ac383d3aee4","resolution":{"observed_at":"2026-08-04T18:58:10.996179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.0767","last_updated":"2015-10-07T01:29:12Z","snapshot_observed_at":"2026-08-22T08:27:47.925683Z","submitted_at":"2014-12-02T03:05:54Z","title":"Learning Spatiotemporal Features with 3D Convolutional Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.0767","snapshot_observed_at":"2026-08-04T18:58:11.004855Z","title":"arXiv:1412.0767","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:11.004855Z"},"links":{"cited_paper":"/paper/1412.0767","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:3d81df201d35e61faf567f60eefed81e516d7070ea6b13f7cbcc4185ca9c4144","observation_id":"4ad22f3d-e6d7-46ea-903b-8b16bd825241","resolution":{"observed_at":"2026-08-04T18:58:11.004855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.08500","last_updated":"2018-01-12T14:05:44Z","snapshot_observed_at":"2026-08-22T05:12:22.477450Z","submitted_at":"2017-06-26T17:45:23Z","title":"GANs Trained by a Two Time-Scale Update Rule Converge to a Local Nash Equilibrium","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.08500","snapshot_observed_at":"2026-08-04T18:58:10.922490Z","title":"arXiv:1706.08500","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:10.922490Z"},"links":{"cited_paper":"/paper/1706.08500","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:8ab891905ea334e8359735e3cba084c100c6606e4e13b1de48f1e004f42170e0","observation_id":"55714084-7ff2-4085-814b-b1580248107e","resolution":{"observed_at":"2026-08-04T18:58:10.922490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-22T10:00:20.553295Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-04T18:58:11.009224Z","title":"arXiv:1812.01717","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:11.009224Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:12d9890a854a24773da864f30df30d92e1895f6f037490f08a7f698a53cb5adc","observation_id":"57b70c0c-7f6c-4230-b65a-1b5ff02f817b","resolution":{"observed_at":"2026-08-04T18:58:11.009224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-04T18:58:10.991325Z","title":"arXiv:2010.02502","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:10.991325Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:5290839537dbf08c987844027cef1997adfa5a44bea8eba584a5f2907ab73abd","observation_id":"02cf6cb7-f7c8-46e1-8125-756c1754cef0","resolution":{"observed_at":"2026-08-04T18:58:10.991325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.06377","last_updated":"2021-12-19T19:23:25Z","snapshot_observed_at":"2026-08-17T17:58:26.288570Z","submitted_at":"2021-11-11T18:46:40Z","title":"Masked Autoencoders Are Scalable Vision Learners","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.06377","snapshot_observed_at":"2026-08-04T18:58:10.918242Z","title":"arXiv:2111.06377","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:10.918242Z"},"links":{"cited_paper":"/paper/2111.06377","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:8f40bdcce4d49fb6bde40f1186c6d7761c51e64fea6a4d36ab787ef77cbffcb6","observation_id":"2987a97f-4eed-45ad-af7d-840e56491d7f","resolution":{"observed_at":"2026-08-04T18:58:10.918242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-16T02:30:42.660030Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-04T18:58:10.944247Z","title":"arXiv preprint arXiv:2210.02747","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:10.944247Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:7664b7c0f903a165a40a2baed2806354b6fd312f78d6d513b77d88f30ddb6531","observation_id":"6f7e5855-ea2d-4866-abef-f2ca3b8b97a4","resolution":{"observed_at":"2026-08-04T18:58:10.944247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-04T18:58:10.888699Z","title":"arXiv:2310.00426","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:10.888699Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:2bdeb2d037d634d4e67bc7124f155361b9b562c317dd564d604ef1b918e0eecc","observation_id":"26b0d4e0-4b54-4a25-8570-7882cd0b2820","resolution":{"observed_at":"2026-08-04T18:58:10.888699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-08-13T01:47:21.043519Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03206","snapshot_observed_at":"2026-08-04T18:58:10.898380Z","title":"arXiv:2403.03206","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:10.898380Z"},"links":{"cited_paper":"/paper/2403.03206","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:6c3e60191b31a1800c7ba41b6a48617732498442cd786275fede589ee64ff500","observation_id":"9109bb9a-2641-4b02-b1c2-bdea3a36d576","resolution":{"observed_at":"2026-08-04T18:58:10.898380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-13T21:01:04.724772Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02492","snapshot_observed_at":"2026-08-04T18:58:10.883059Z","title":"arXiv preprint arXiv:2502.02492","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:10.883059Z"},"links":{"cited_paper":"/paper/2502.02492","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:1d2b24a9aab81e8af3e46ee1e35c894005a7b98dd9b02681e727da8fd3d21dcd","observation_id":"38f8dc10-0612-4b39-8cff-48529173ae1b","resolution":{"observed_at":"2026-08-04T18:58:10.883059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2509.09547."}