{"as_of":"2026-08-09T04:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2236fa796b4c4915d8a71c420b662588738c1d6bfce90b4d0744e677f87cc5a7","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T16:36:00.861663Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:15:14.861189Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T18:14:17.525731Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06155","snapshot_observed_at":"2026-08-07T11:15:14.861189Z","title":"Efficient-vdit: Efficient video diffusion transformers with attention tile.arXiv preprint arXiv:2502.06155, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:14.861189Z"},"links":{"cited_paper":"/paper/2502.06155","citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:42626f5c32b19ff47d37ad1444832c84b447c14650261e8220fc8749d6e25b56","observation_id":"008a59f2-17ab-48b3-91c7-ab475280a28d","resolution":{"observed_at":"2026-08-07T11:15:14.861189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06155","snapshot_observed_at":"2026-08-03T22:12:43.020208Z","title":"Efficient-vdit: Ef- ficient video diffusion transformers with attention tile.arXiv preprint arXiv:2502.06155, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.12035","last_updated":"2026-07-21T06:26:07Z","snapshot_observed_at":"2026-08-08T23:56:39.865292Z","submitted_at":"2025-11-15T05:07:31Z","title":"Timeripple: Accelerating vDiTs by Understanding the Spatio-Temporal Correlations in Latent Space","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T22:12:43.020208Z"},"links":{"cited_paper":"/paper/2502.06155","citing_paper":"/paper/2511.12035"},"observation_digest":"sha256:25b74efa22af2fa9b08420fdc2c123e69eeb36d378574431f7bf4a6a4b466c0c","observation_id":"16db170a-0ee8-4b88-b45f-2067dfdae9be","resolution":{"observed_at":"2026-08-03T22:12:43.020208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"cited_work":{"arxiv_id":"2502.06155","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06155","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient-vdit: Efficient video diffusion transformers with attention tile","venue":null,"work_id":"55e7d21d-77c6-4bfb-bb90-d47aab8cd73e","year":2025},"citing_paper":{"arxiv_id":"2603.09721","last_updated":"2026-04-18T11:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-10T14:28:32Z","title":"FrameDiT: Diffusion Transformer with Matrix Attention for Efficient Video Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T13:27:23.641294Z"},"links":{"cited_paper":"/paper/2502.06155","citing_paper":"/paper/2603.09721"},"observation_digest":"sha256:ec4328eb72984611a7068d59e2d6bfec4684d60c1e4b0a9c0293c42f991d86d0","observation_id":"973b95b9-d8d5-4b68-b726-7c95623b619c","resolution":{"observed_at":"2026-05-15T13:30:01.676254Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"cited_work":{"arxiv_id":"2502.06155","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06155","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient-vdit: Efficient video diffusion transformers with attention tile","venue":null,"work_id":"55e7d21d-77c6-4bfb-bb90-d47aab8cd73e","year":2025},"citing_paper":{"arxiv_id":"2603.21002","last_updated":"2026-05-18T13:08:31Z","snapshot_observed_at":"2026-07-06T22:50:01.539214Z","submitted_at":"2025-11-25T18:54:45Z","title":"SURF: Signature-Retained Fast Video Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T18:11:39.642701Z"},"links":{"cited_paper":"/paper/2502.06155","citing_paper":"/paper/2603.21002"},"observation_digest":"sha256:29812c83b57bc24e1a4155b281602a8e267226bf7372a3eca90e591762b3a969","observation_id":"1cd29495-3fdc-4fb0-b51f-6c0b3c14d5f8","resolution":{"observed_at":"2026-05-21T18:14:17.530161Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"cited_work":{"arxiv_id":"2502.06155","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06155","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient-vdit: Efficient video diffusion transformers with attention tile","venue":null,"work_id":"55e7d21d-77c6-4bfb-bb90-d47aab8cd73e","year":2025},"citing_paper":{"arxiv_id":"2604.15911","last_updated":"2026-04-17T10:11:39Z","snapshot_observed_at":"2026-07-06T23:03:21.422544Z","submitted_at":"2026-04-17T10:11:39Z","title":"Efficient Video Diffusion Models: Advancements and Challenges","version":1},"reference_index":253,"source":"pdf_text","source_observed_at":"2026-05-10T08:28:29.706249Z"},"links":{"cited_paper":"/paper/2502.06155","citing_paper":"/paper/2604.15911"},"observation_digest":"sha256:60b460429d13233e5dd46e8b5d042af58baf33f6bacb6742fb6255eebcc17287","observation_id":"2045bde9-21ee-41bd-a5a1-7b8dcb8be5b8","resolution":{"observed_at":"2026-05-10T09:03:26.274718Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06155","snapshot_observed_at":"2026-08-02T03:51:43.943264Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13770","last_updated":"2026-07-15T12:31:19Z","snapshot_observed_at":"2026-08-07T21:19:01.846235Z","submitted_at":"2026-07-15T12:31:19Z","title":"Kaleido: Algorithm-Hardware Co-Design for Video Diffusion Transformers by Exploiting Latent Space Correlations","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T03:51:43.943264Z"},"links":{"cited_paper":"/paper/2502.06155","citing_paper":"/paper/2607.13770"},"observation_digest":"sha256:daab746c51ad54c52440706e7e8208478b79b87a67e83da8d1f9430e11c0dea0","observation_id":"3a8ccec0-e467-4c0b-975b-0a4a56fcb7f0","resolution":{"observed_at":"2026-08-02T03:51:43.943264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06155","snapshot_observed_at":"2026-08-02T00:49:33.632515Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14908","last_updated":"2026-07-16T12:28:01Z","snapshot_observed_at":"2026-08-08T23:56:38.953192Z","submitted_at":"2026-07-16T12:28:01Z","title":"CODA: Algorithm-Hardware Co-design for Edge Video Diffusion via NMP-Enabled Compute-Cache Operator Disaggregation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T00:49:33.632515Z"},"links":{"cited_paper":"/paper/2502.06155","citing_paper":"/paper/2607.14908"},"observation_digest":"sha256:59362da82bd4c83240b152658583279e764832b7691d554300966e1d96400fea","observation_id":"d95da06c-d323-4e3b-8906-bdae06a2850c","resolution":{"observed_at":"2026-08-02T00:49:33.632515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06155","snapshot_observed_at":"2026-07-31T02:16:07.984738Z","title":"Efficient-vdit: Efficient video diffusion transformers with attention tile.arXiv preprint arXiv:2502.06155, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-03T00:12:46.043696Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:07.984738Z"},"links":{"cited_paper":"/paper/2502.06155","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:3d9f2423e90e120139e3f805d773bfb38db78e8589079b364c3b05f901621f83","observation_id":"2ed05fa7-6588-4b8f-a38b-f139a7e59178","resolution":{"observed_at":"2026-07-31T02:16:07.984738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06155","snapshot_observed_at":"2026-08-05T20:50:03.963203Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03335","last_updated":"2026-08-04T08:47:57Z","snapshot_observed_at":"2026-08-08T15:40:55.073428Z","submitted_at":"2026-08-04T08:47:57Z","title":"SPADE: An Input-Adaptive Sparse Attention Engine for Fast Video Diffusion Models Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T20:50:03.963203Z"},"links":{"cited_paper":"/paper/2502.06155","citing_paper":"/paper/2608.03335"},"observation_digest":"sha256:b5e76b8da23d1db487910e7bd30b4a9ed8dab9371e115f6df34e569b40c4687c","observation_id":"2130302b-c659-4d29-bfc2-118e11d201be","resolution":{"observed_at":"2026-08-05T20:50:03.963203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.06155/citation-record","integrity":"/paper/2502.06155/integrity","json":"/paper/2502.06155/citation-record.json","paper":"/paper/2502.06155"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:36:00.534034Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.534034Z"},"links":{"citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:e545831d890264cdfce435006dd4bf86516445664a03ce77b5f706fc57dcb850","observation_id":"879f14bd-8897-4969-9900-68ec4584cc42","resolution":{"observed_at":"2026-08-08T16:36:00.534034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:36:00.541123Z","title":"Y., Suk, H., Suo, M., Tillet, P., Wang, E., Wang, X., Wen, W., Zhang, S., Zhao, X., Zhou, K., Zou, R., Mathews, A., Chanan, G., Wu, P., and Chintala, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.541123Z"},"links":{"citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:ec16aa858d05fc8cbc787272cbabfac96c1af48376731226ce0ee60ab4e40e6b","observation_id":"e2c047e6-018d-4017-9d2d-0c0849c635c9","resolution":{"observed_at":"2026-08-08T16:36:00.541123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01392","last_updated":"2024-12-10T01:32:23Z","snapshot_observed_at":"2026-08-06T12:36:01.385451Z","submitted_at":"2024-07-01T15:43:25Z","title":"Diffusion Forcing: Next-token Prediction Meets Full-Sequence Diffusion","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01392","snapshot_observed_at":"2026-08-08T16:36:00.547084Z","title":"M., Du, Y., Simchowitz, M., Tedrake, R., and Sitzmann, V","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.547084Z"},"links":{"cited_paper":"/paper/2407.01392","citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:8a23d1c42cb48fbce2874fbdeb116e6daab8132a44a898b912e95506cbbe99b6","observation_id":"94fdb3b5-3a01-4cb0-b2ab-da78858b4676","resolution":{"observed_at":"2026-08-08T16:36:00.547084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:36:01.969941Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffusion models","venue":null,"work_id":"03d4f451-4dc2-4132-8622-a757f7b0e379","year":2024},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.552831Z"},"links":{"citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:7d1e768de2446e34d7ad70c2fcc020d67f045cc12508fbf236fde1033ac5c2fb","observation_id":"23dd000f-b5b3-4022-97f3-7505abd9fa95","resolution":{"observed_at":"2026-08-08T16:36:01.975333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19479","last_updated":"2024-02-29T18:59:50Z","snapshot_observed_at":"2026-08-08T15:16:15.308854Z","submitted_at":"2024-02-29T18:59:50Z","title":"Panda-70M: Captioning 70M Videos with Multiple Cross-Modality Teachers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19479","snapshot_observed_at":"2026-08-08T16:36:00.558029Z","title":"E., Fang, Y., Lee, H.-Y., Ren, J., Yang, M.-H., and Tulyakov, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.558029Z"},"links":{"cited_paper":"/paper/2402.19479","citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:021eba68f0036ab48839999a54c76c5ce4755b1dbd59506a1cc5699cd0e683ad","observation_id":"3617f228-9ea2-488b-ac75-bc512ca23935","resolution":{"observed_at":"2026-08-08T16:36:00.558029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06911","last_updated":"2024-09-26T05:47:36Z","snapshot_observed_at":"2026-08-05T15:19:29.084626Z","submitted_at":"2024-06-11T03:09:37Z","title":"AsyncDiff: Parallelizing Diffusion Models by Asynchronous Denoising","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06911","snapshot_observed_at":"2026-08-08T16:36:00.563170Z","title":"Asyncdiff: Parallelizing diffusion models by asynchronous denoising","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.563170Z"},"links":{"cited_paper":"/paper/2406.06911","citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:4c41485bf98f0b9b7ede26016156b1a7351b28f487870a13cd7e827800f6a234","observation_id":"975d6dc2-04b2-4da4-9c6d-61c4045da716","resolution":{"observed_at":"2026-08-08T16:36:00.563170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:36:01.954033Z","title":"Structure and content-guided video synthesis with diffusion models","venue":null,"work_id":"7afe014d-98f4-4f1e-a2f2-48c717564c85","year":2023},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.568777Z"},"links":{"citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:5abc58219cd11156c5163f80e107ce042192c5640d0757ba9b764b374404669b","observation_id":"f5d93968-c1ec-47fd-8386-7c3093811bdb","resolution":{"observed_at":"2026-08-08T16:36:01.959428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:36:01.937858Z","title":"Preserve your own correlation: A noise prior for video diffusion models","venue":null,"work_id":"9d73e1df-41ae-4e83-810e-18efe1f40732","year":2023},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.574079Z"},"links":{"citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:ced98c73f3a3efc7a691453d44719ae4e0fa276991678aea137c5a1caa7caaed","observation_id":"f5140fd8-15b7-40e8-845d-d72673f0fbf0","resolution":{"observed_at":"2026-08-08T16:36:01.943274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-08T16:36:00.578900Z","title":"Model tells you what to discard: Adaptive kv cache compression for llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.578900Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:ee527990495024d9aaf0dc56cb0b49e354402d3a9acbefdbade756d5e86306d4","observation_id":"6c56835c-c689-4e44-9464-c3a5b6ad6d80","resolution":{"observed_at":"2026-08-08T16:36:00.578900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12391","last_updated":"2024-04-18T17:59:58Z","snapshot_observed_at":"2026-07-06T18:02:19.428801Z","submitted_at":"2024-04-18T17:59:58Z","title":"On the Content Bias in Fr\\'echet Video Distance","version":1},"cited_work":{"arxiv_id":"2404.12391","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.12391","snapshot_observed_at":"2026-08-08T16:36:01.408123Z","title":"On the Content Bias in Fr\\'echet Video Distance","venue":"cs.CV","work_id":"6503bc05-2840-4cc9-b64d-1e132f3a0d10","year":2024},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.588110Z"},"links":{"cited_paper":"/paper/2404.12391","citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:05e63b53458ca7b5f255c7d3a1a4b5de968588be3a12264bd27db8829650d054","observation_id":"95b604a4-94a5-46ee-a241-27d48f4770f4","resolution":{"observed_at":"2026-08-08T16:36:01.413556Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:36:00.593452Z","title":"Minillm: Knowledge distillation of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.593452Z"},"links":{"citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:9f64dad38c582e650538a1c9f8ff4989a8479d23e5f69952cbfc8ad88db3ab0b","observation_id":"b06056eb-23ec-4515-9315-e6d092b44994","resolution":{"observed_at":"2026-08-08T16:36:00.593452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16933","last_updated":"2023-11-28T16:33:08Z","snapshot_observed_at":"2026-07-06T16:53:55.269172Z","submitted_at":"2023-11-28T16:33:08Z","title":"SparseCtrl: Adding Sparse Controls to Text-to-Video Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16933","snapshot_observed_at":"2026-08-08T16:36:00.598080Z","title":"Sparsectrl: Adding sparse controls to text-to-video diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.598080Z"},"links":{"cited_paper":"/paper/2311.16933","citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:47bd6e12f8b405936285d9260054beb0fdc89c0d4db27cf01f34754829bc859d","observation_id":"79bb3bb3-11da-4713-b672-1b9069214617","resolution":{"observed_at":"2026-08-08T16:36:00.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:36:00.603175Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.603175Z"},"links":{"citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:94ff73532ce75b1768a22774432073b6205ea35b0fc281962fb9bdda53d59f0e","observation_id":"2b792012-9c03-4fad-a65b-fc3bd61c0616","resolution":{"observed_at":"2026-08-08T16:36:00.603175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-08T16:36:00.608167Z","title":"Latent video diffusion models for high-fidelity long video generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.608167Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:02bf9a0ee1910690d313daef4a05ead8a8a19f6bb716770a006cf0182856be23","observation_id":"d397fb01-a86c-4445-9c71-b94dde4ecc35","resolution":{"observed_at":"2026-08-08T16:36:00.608167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06807","last_updated":"2024-11-19T14:31:02Z","snapshot_observed_at":"2026-08-03T11:30:00.885783Z","submitted_at":"2024-03-11T15:26:34Z","title":"Multistep Consistency Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06807","snapshot_observed_at":"2026-08-08T16:36:00.613132Z","title":"Multistep consistency models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.613132Z"},"links":{"cited_paper":"/paper/2403.06807","citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:8b48c89a33101ca741582737141b553a0f24444bcd5b68d1ac883a8e093db49f","observation_id":"81427793-320b-4014-a568-6d264499d586","resolution":{"observed_at":"2026-08-08T16:36:00.613132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14773","last_updated":"2025-04-16T13:38:58Z","snapshot_observed_at":"2026-08-06T14:42:35.046089Z","submitted_at":"2024-03-21T18:27:29Z","title":"StreamingT2V: Consistent, Dynamic, and Extendable Long Video Generation from Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14773","snapshot_observed_at":"2026-08-08T16:36:00.618081Z","title":"Streamingt2v: Consistent, dynamic, and extendable long video generation from text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.618081Z"},"links":{"cited_paper":"/paper/2403.14773","citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:86b559a6d0081c92c97ff6cb05234df0162e3853a30dffcb6d0379353b82a2eb","observation_id":"d574554b-c171-469c-8e83-d1eb0ff321a1","resolution":{"observed_at":"2026-08-08T16:36:00.618081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-08T16:36:00.623076Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.623076Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:d73aa10175bf2d5848ff2231599f51c8f4c655762d58344513eadb569ce0b108","observation_id":"8c2a1d30-9d77-4ce8-8a82-d5055a71632b","resolution":{"observed_at":"2026-08-08T16:36:00.623076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:36:00.628369Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.628369Z"},"links":{"citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:70065f7ed2096a1673be6d2700f155682d102fa7defa277098c0d63ef4270070","observation_id":"4128552a-5a2b-480d-9054-de6b48d2bd65","resolution":{"observed_at":"2026-08-08T16:36:00.628369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:36:00.633493Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.633493Z"},"links":{"citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:446753dbbf68327f4175878698dc8209dd0c5b091e71cb60c7ca51bf9ce4eac5","observation_id":"08444821-546c-4338-8499-1097e243eb58","resolution":{"observed_at":"2026-08-08T16:36:00.633493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14509","last_updated":"2023-10-04T16:51:13Z","snapshot_observed_at":"2026-08-04T19:27:31.715261Z","submitted_at":"2023-09-25T20:15:57Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14509","snapshot_observed_at":"2026-08-08T16:36:00.638410Z","title":"A., Tanaka, M., Zhang, C., Zhang, M., Song, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.638410Z"},"links":{"cited_paper":"/paper/2309.14509","citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:f291e3421d8efdf2b62a9d7235f39af0292a6935b5327889ee01f10bb67cf80a","observation_id":"8c3f9113-e61b-4bff-a736-3c791cd2e5bd","resolution":{"observed_at":"2026-08-08T16:36:00.638410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.10351","last_updated":"2020-10-16T02:12:46Z","snapshot_observed_at":"2026-08-07T22:21:53.513424Z","submitted_at":"2019-09-23T13:05:35Z","title":"TinyBERT: Distilling BERT for Natural Language Understanding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.10351","snapshot_observed_at":"2026-08-08T16:36:00.644229Z","title":"Tinybert: Distilling bert for natural language understanding","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.644229Z"},"links":{"cited_paper":"/paper/1909.10351","citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:a0cc4a8eea240eba9c670d7176c0703eec91d099e12acfb346932b00be5316e2","observation_id":"373c26d2-28b7-4781-a4cf-40710192aefa","resolution":{"observed_at":"2026-08-08T16:36:00.644229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02279","last_updated":"2024-03-30T06:29:48Z","snapshot_observed_at":"2026-07-06T16:27:18.829052Z","submitted_at":"2023-10-01T05:07:17Z","title":"Consistency Trajectory Models: Learning Probability Flow ODE Trajectory of Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02279","snapshot_observed_at":"2026-08-08T16:36:00.649412Z","title":"Consistency trajectory models: Learning probability flow ode trajectory of diffusion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.649412Z"},"links":{"cited_paper":"/paper/2310.02279","citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:6380065d7df50b36a96751a95b4d0f3dc87aa0a78c609359f52d5dcfe5787623","observation_id":"ee4c3a19-5c23-4914-89ff-83d79a0ea2e2","resolution":{"observed_at":"2026-08-08T16:36:00.649412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:36:01.876163Z","title":"Kling, 2024","venue":null,"work_id":"5d6e06c7-bd90-401d-8c53-38a1847d8149","year":2024},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.654609Z"},"links":{"citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:1e57b37129b4d690088ee5e6658e626ff109649e98abb760ee1b54ccfc47f216","observation_id":"52f6ec41-0aa7-48ea-919c-40820754231b","resolution":{"observed_at":"2026-08-08T16:36:01.881048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:36:00.659388Z","title":"and etc., T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.659388Z"},"links":{"citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:c8805688c331c29869241a4e4e67432185a78a6b0cb1bba5cca18a681794e75a","observation_id":"ec3a272e-1247-4ef0-a729-a882cd471b99","resolution":{"observed_at":"2026-08-08T16:36:00.659388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:36:01.859329Z","title":"P., Ma, X., Stoica, I., Gonzalez, J","venue":null,"work_id":"cf4c60c3-e19f-4b04-88d4-5b9fae60f193","year":2024},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.664372Z"},"links":{"citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:e4ca16166d35dd8d1b15a15a03dfd4d2969ec75523593539124867376c56f304","observation_id":"ba841194-aa46-4883-be2b-dbf16191b945","resolution":{"observed_at":"2026-08-08T16:36:01.865018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18750","last_updated":"2024-10-11T07:50:49Z","snapshot_observed_at":"2026-08-08T11:19:14.293609Z","submitted_at":"2024-05-29T04:26:17Z","title":"T2V-Turbo: Breaking the Quality Bottleneck of Video Consistency Model with Mixed Reward Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18750","snapshot_observed_at":"2026-08-08T16:36:00.669349Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.669349Z"},"links":{"cited_paper":"/paper/2405.18750","citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:9590e46d95f2fa3eebed4f8c5d371df4839428e9c0d4eb8cf7af255868be5298","observation_id":"f1194f38-bc35-473c-bff2-3b3ba0fd07fa","resolution":{"observed_at":"2026-08-08T16:36:00.669349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:36:01.843469Z","title":"Gan compression: Efficient architectures for interactive conditional gans","venue":null,"work_id":"94b097d6-c834-42f8-8eb5-f29cb0c58969","year":2020},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.675076Z"},"links":{"citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:cdf070fce42d8e87aec07ef9c5392773c5b304248aaec62c316e167aab6132a2","observation_id":"1ea50d30-0989-4e70-9fea-4c677e1b1951","resolution":{"observed_at":"2026-08-08T16:36:01.848657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:36:01.826873Z","title":"Efficient spatially sparse inference for conditional gans and diffusion models","venue":null,"work_id":"162c146a-8724-4ad5-8a0a-0ba90f6b7caf","year":2022},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.680165Z"},"links":{"citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:0473d964991ac4b2a45643b7c6ac0a2301a533d69a445f2ff5306115e68b808c","observation_id":"6117cdd6-ea7e-47c8-9858-4876a5d0c5f0","resolution":{"observed_at":"2026-08-08T16:36:01.832465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:36:01.810904Z","title":"Distrifusion: Distributed parallel inference for high-resolution diffusion models","venue":null,"work_id":"8e5754cf-b08f-47ab-9ef5-acec89e28f34","year":2024},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.684959Z"},"links":{"citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:110560e86681ac08f8d5d5cf13d20b7cefd37217f8c119969c43a8a7a926dca8","observation_id":"9e7e5081-aa54-4346-88b7-55968b2cb0ae","resolution":{"observed_at":"2026-08-08T16:36:01.815764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-08-07T09:22:20.831075Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01889","snapshot_observed_at":"2026-08-08T16:36:00.689851Z","title":"Ring attention with blockwise transformers for near-infinite context","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.689851Z"},"links":{"cited_paper":"/paper/2310.01889","citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:63215e34102ed800ff1b1a808fd77e18e11274058e8ef86e5e97f59c6d9e0b12","observation_id":"8a6531b9-4286-46d4-b2f5-4ba4884aa181","resolution":{"observed_at":"2026-08-08T16:36:00.689851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01505","last_updated":"2025-03-05T11:39:35Z","snapshot_observed_at":"2026-08-02T22:26:19.659706Z","submitted_at":"2024-03-03T13:08:32Z","title":"SCott: Accelerating Diffusion Models with Stochastic Consistency Distillation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01505","snapshot_observed_at":"2026-08-08T16:36:00.694874Z","title":"Scott: Accelerating diffusion models with stochastic consistency distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.694874Z"},"links":{"cited_paper":"/paper/2403.01505","citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:7a6f425509f4808363137aee5f2abdcc22e565a0dc1044c0626db82268b96e5d","observation_id":"34ff312d-c82d-4f7b-8a16-a27331ac2984","resolution":{"observed_at":"2026-08-08T16:36:00.694874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:36:00.699889Z","title":"Instaflow: One step is enough for high-quality diffusion-based text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.699889Z"},"links":{"citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:163310957d9613697980e94df486244d6ad05b36f61fa627c7621977070ff68b","observation_id":"6395adc7-bdb8-4d45-8888-63c79c31f51c","resolution":{"observed_at":"2026-08-08T16:36:00.699889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:36:01.785331Z","title":"Dpm-solver: A fast ode solver for diffusion probabilistic model sampling in around 10 steps","venue":null,"work_id":"22d78b75-f1ab-435c-b56b-6b2b682e038a","year":2022},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.704323Z"},"links":{"citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:95dc10d4097768186ab76067e7d65450c04682ecdebdf291c284bd85f6142aaf","observation_id":"210e0a49-8d13-4b2f-8a6a-fc9b75f451a7","resolution":{"observed_at":"2026-08-08T16:36:01.790332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01095","last_updated":"2025-05-19T07:56:56Z","snapshot_observed_at":"2026-07-29T20:17:21.488997Z","submitted_at":"2022-11-02T13:14:30Z","title":"DPM-Solver++: Fast Solver for Guided Sampling of Diffusion Probabilistic Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01095","snapshot_observed_at":"2026-08-08T16:36:00.709202Z","title":"Dpm-solver++: Fast solver for guided sampling of diffusion probabilistic models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.709202Z"},"links":{"cited_paper":"/paper/2211.01095","citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:7879eb71147c5fa0e55b1e9d154754499c53e1ffeec8b84872bb6233ccefd568","observation_id":"c48b333d-5f01-4c90-8b43-5a44db7eee13","resolution":{"observed_at":"2026-08-08T16:36:00.709202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:36:01.769830Z","title":"Videofusion: Decomposed diffusion models for high-quality video generation","venue":null,"work_id":"7483b790-710f-4324-b915-f4625256b671","year":2023},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.714008Z"},"links":{"citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:09c441b7cc764a4556a2680ac34bf1224458c4a43f0e716cc40bf63dcfd68c0b","observation_id":"09ebc99d-2e30-493a-99e6-02c869278f38","resolution":{"observed_at":"2026-08-08T16:36:01.774778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-02T13:01:06.918463Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-08-08T16:36:00.718429Z","title":"Latte: Latent diffusion transformer for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.718429Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:deb014bec791e082db27600f988d1b0ba7717c09874c144c06dd806e291bf702","observation_id":"4369801d-eae4-41d2-9d92-d0386cb75f01","resolution":{"observed_at":"2026-08-08T16:36:00.718429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:36:00.723424Z","title":"and Lee, W","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.723424Z"},"links":{"citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:6eee010748e308b6aa8af61f304807aa19d57fa6b122371af79c1c76c0555bdb","observation_id":"df435bc0-cfe3-44b0-aeff-f205b4536f37","resolution":{"observed_at":"2026-08-08T16:36:00.723424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:36:01.754550Z","title":"Sora, 2024","venue":null,"work_id":"40cc52af-f6a7-42ea-b0d3-048d1d83354e","year":2024},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.728113Z"},"links":{"citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:455ddca39c4b1d189fb1409caa97f94b4d3442cca35ce1d100830c6197014c09","observation_id":"cca92412-a4ac-4814-9aee-d89e3f6c4bf8","resolution":{"observed_at":"2026-08-08T16:36:01.759391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:36:00.733125Z","title":"and Xie, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.733125Z"},"links":{"citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:b397f3c63c6e9e2f17ff53d2bb06286ce5bcd1744480195215c293f6be039378","observation_id":"71f51c61-a5a8-47b6-b1c6-029caaba7697","resolution":{"observed_at":"2026-08-08T16:36:00.733125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:36:01.729669Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"c1ae0cf9-95fc-4aac-b246-8903d1e95b4b","year":2022},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.737723Z"},"links":{"citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:b12d4e1599d31598b35b3ba8e6bdb418c0f01af8749abc64465a2b78d843b288","observation_id":"f95b307f-42c2-4129-a6fd-3bf2ab82a32d","resolution":{"observed_at":"2026-08-08T16:36:01.734673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:36:01.713848Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"9ab44b28-1513-4c47-8b24-3a89846638af","year":2022},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.742357Z"},"links":{"citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:b8973aff9fbb6dfc56d590c189ee68ef907a76d5ac75d3efa8a288098590b8e2","observation_id":"d9a83c0a-1467-4d86-853a-eb68bd8eaeee","resolution":{"observed_at":"2026-08-08T16:36:01.718989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00512","last_updated":"2022-06-07T09:17:35Z","snapshot_observed_at":"2026-07-06T12:33:23.843893Z","submitted_at":"2022-02-01T16:07:25Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00512","snapshot_observed_at":"2026-08-08T16:36:00.747307Z","title":"and Ho, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.747307Z"},"links":{"cited_paper":"/paper/2202.00512","citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:2124ee5d502912e765870b676020284c05b6eb92fe2662eaf9cc02ddb67975ac","observation_id":"c68dbbd0-a155-4ac4-8e39-e520e894b14f","resolution":{"observed_at":"2026-08-08T16:36:00.747307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17042","last_updated":"2023-11-28T18:53:24Z","snapshot_observed_at":"2026-07-06T16:53:58.875152Z","submitted_at":"2023-11-28T18:53:24Z","title":"Adversarial Diffusion Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17042","snapshot_observed_at":"2026-08-08T16:36:00.753095Z","title":"Adversarial diffusion distillation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.753095Z"},"links":{"cited_paper":"/paper/2311.17042","citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:0e5db9630b15a28d64f40861ad081e6a3f0b7a548af6443ec0c9fb0c9ecf3698","observation_id":"ae08ac42-847a-4636-ab6c-70423dbdd4a0","resolution":{"observed_at":"2026-08-08T16:36:00.753095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-08T16:36:00.758040Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.758040Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:71dc19b9c9a1c282c6e945f56191d68fbc5e60b0f4a12cf57c3aeeda61432996","observation_id":"d3c89bfd-6543-412a-ac7b-0ced928d0023","resolution":{"observed_at":"2026-08-08T16:36:00.758040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01469","last_updated":"2023-05-31T06:17:10Z","snapshot_observed_at":"2026-07-06T14:58:02.852672Z","submitted_at":"2023-03-02T18:30:16Z","title":"Consistency Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01469","snapshot_observed_at":"2026-08-08T16:36:00.763069Z","title":"Consistency models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.763069Z"},"links":{"cited_paper":"/paper/2303.01469","citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:15899ed3d9210dcd7aeb034564f286f95e89195423f21066c7fa35b7a612f410","observation_id":"75110f21-8cc3-4805-8c5d-3b1bdc07800e","resolution":{"observed_at":"2026-08-08T16:36:00.763069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:36:00.767848Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.767848Z"},"links":{"citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:6a23cb2c5d7e7da8f7076ae9362ebba0583c07f9532a358f4eeedd0c51e63f3c","observation_id":"a543757e-31a1-43ac-90c6-f7400c65e591","resolution":{"observed_at":"2026-08-08T16:36:00.767848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14837","last_updated":"2025-04-24T03:03:57Z","snapshot_observed_at":"2026-07-06T19:06:23.640089Z","submitted_at":"2024-08-27T07:46:07Z","title":"Diffusion Models Are Real-Time Game Engines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14837","snapshot_observed_at":"2026-08-08T16:36:00.772590Z","title":"Diffusion models are real-time game engines","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.772590Z"},"links":{"cited_paper":"/paper/2408.14837","citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:c2d7b9ab25f6656ec333f64017c93b4b383391f3c58f36c3d7b3a19059088da1","observation_id":"b7a74510-49f8-4de6-a7b3-1a8765b6c936","resolution":{"observed_at":"2026-08-08T16:36:00.772590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:36:01.688041Z","title":"Cuttlefish: Low-rank model training without all the tuning","venue":null,"work_id":"98add929-ed66-4c5d-8b54-2bbaa6947a0d","year":2023},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.777502Z"},"links":{"citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:bc62f56d3ba8533347e01f02b8b446bd0e3fec1e0346dad9541f3777b34ffea2","observation_id":"962af9a9-3917-4d53-8bb3-db2c8ba70ff0","resolution":{"observed_at":"2026-08-08T16:36:01.693012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14430","last_updated":"2025-12-03T10:59:23Z","snapshot_observed_at":"2026-08-08T21:50:02.096694Z","submitted_at":"2024-05-23T11:00:07Z","title":"PipeFusion: Patch-level Pipeline Parallelism for Diffusion Transformers Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14430","snapshot_observed_at":"2026-08-08T16:36:00.782163Z","title":"Pipefusion: Displaced patch pipeline parallelism for inference of diffusion transformer models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.782163Z"},"links":{"cited_paper":"/paper/2405.14430","citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:ed923721d4a3b6b7f26eaedd2ce57671a1041bdc8ac5ca9dbdf34aa81c8d1d33","observation_id":"69b1b477-c1dd-4da0-b5e0-3b25019a5d32","resolution":{"observed_at":"2026-08-08T16:36:00.782163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04005","last_updated":"2024-10-04T13:45:54Z","snapshot_observed_at":"2026-07-06T19:11:22.631548Z","submitted_at":"2024-09-06T03:13:45Z","title":"Qihoo-T2X: An Efficient Proxy-Tokenized Diffusion Transformer for Text-to-Any-Task","version":2},"cited_work":{"arxiv_id":"2409.04005","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.04005","snapshot_observed_at":"2026-08-08T16:36:01.082749Z","title":"Qihoo-T2X: An Efficient Proxy-Tokenized Diffusion Transformer for Text-to-Any-Task","venue":"cs.CV","work_id":"b382732e-3c8b-4999-b55b-ca494cb1edcd","year":2024},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.787293Z"},"links":{"cited_paper":"/paper/2409.04005","citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:7a1f3d3d151356876b6ab2d70e94343849610381ba64f45ce4ffd84c9e3a2d28","observation_id":"0fb27e87-ed33-484a-86bd-24e83633a040","resolution":{"observed_at":"2026-08-08T16:36:01.090091Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09109","last_updated":"2023-12-14T16:45:36Z","snapshot_observed_at":"2026-08-05T19:13:07.732946Z","submitted_at":"2023-12-14T16:45:36Z","title":"VideoLCM: Video Latent Consistency Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09109","snapshot_observed_at":"2026-08-08T16:36:00.792125Z","title":"Videolcm: Video latent consistency model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.792125Z"},"links":{"cited_paper":"/paper/2312.09109","citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:e2eb2a2cda04a67ff58c0ebc6ede8a5a767409ef6cf716f5ed12a84c57859e8d","observation_id":"586ff3f7-6c6c-4c4a-8596-c622ab16b7c8","resolution":{"observed_at":"2026-08-08T16:36:00.792125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15103","last_updated":"2023-09-27T03:51:52Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:52:03Z","title":"LAVIE: High-Quality Video Generation with Cascaded Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15103","snapshot_observed_at":"2026-08-08T16:36:00.797146Z","title":"Lavie: High-quality video generation with cascaded latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.797146Z"},"links":{"cited_paper":"/paper/2309.15103","citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:64d71002ed5453fb1d3e698314d06a3c0d0f3fa433ca4395acb49556e416c5bf","observation_id":"505231f3-b775-4e20-8697-4982d873e473","resolution":{"observed_at":"2026-08-08T16:36:00.797146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-08T08:58:45.984697Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-08T16:36:00.802081Z","title":"Pandora: Towards general world model with natural language actions and video states","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.802081Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:f553a6694dc1af173aabae442133990a0ffe37200710fb059540b6ab9762e91f","observation_id":"5f3bfb9b-99d0-41a7-87be-8553a1dfd701","resolution":{"observed_at":"2026-08-08T16:36:00.802081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-08T16:36:00.806932Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.806932Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:fa0ac27936cee40d7defa576e3a8c4f57aba364f6e89824351e3dc1cbb64d567","observation_id":"045bff2a-e539-43cd-80cd-901e0b89437b","resolution":{"observed_at":"2026-08-08T16:36:00.806932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05768","last_updated":"2024-11-07T01:29:26Z","snapshot_observed_at":"2026-08-05T05:56:20.796228Z","submitted_at":"2024-06-09T12:55:50Z","title":"TLCM: Training-efficient Latent Consistency Model for Image Generation with 2-8 Steps","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05768","snapshot_observed_at":"2026-08-08T16:36:00.811851Z","title":"Mlcm: Multistep consistency distillation of latent diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.811851Z"},"links":{"cited_paper":"/paper/2406.05768","citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:1aa705b013ca0c0760449e79975d7ef44662e770934f4a8a1f7e9307e1e6b920","observation_id":"9de7b43a-c1d2-4d43-8971-9a792400f717","resolution":{"observed_at":"2026-08-08T16:36:00.811851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-08T16:36:00.816958Z","title":"Longvila: Scaling long-context visual language models for long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.816958Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:5aaca4142c05d5136f9599dad0f0c014c0bc9def823093ed3047cfd37df63ee6","observation_id":"d942cf6c-18c6-4c23-948e-73da7d12d445","resolution":{"observed_at":"2026-08-08T16:36:00.816958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11934","last_updated":"2021-03-11T18:45:13Z","snapshot_observed_at":"2026-07-06T10:07:22.052360Z","submitted_at":"2020-10-22T17:58:14Z","title":"mT5: A massively multilingual pre-trained text-to-text transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11934","snapshot_observed_at":"2026-08-08T16:36:00.821782Z","title":"mt5: A massively multilingual pre-trained text-to-text transformer","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.821782Z"},"links":{"cited_paper":"/paper/2010.11934","citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:d81f6ae59b9ec2af14223993f507d13460b069b4db694debde7251d3fad999b3","observation_id":"da45e496-bf4d-48ae-91b9-c1f1b5849839","resolution":{"observed_at":"2026-08-08T16:36:00.821782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-07-06T18:17:08.160308Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-08-08T16:36:00.827553Z","title":"Pyramidinfer: Pyramid kv cache compression for high-throughput llm inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.827553Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:6518e1653bbf253dd67cd8ae7780a27f3941a5190d5eb4b28298982b299d5916","observation_id":"2239970b-c879-4ee0-a22c-4c9f7a1fa120","resolution":{"observed_at":"2026-08-08T16:36:00.827553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-08T16:36:00.832860Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.832860Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:aa392b9f692916776a2767362d7c7f232dccce599a91da92e9ee5b848573fc4b","observation_id":"7a8a4519-ee6a-4f1e-8643-46e7dffecd73","resolution":{"observed_at":"2026-08-08T16:36:00.832860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:36:01.671795Z","title":"T., and Park, T","venue":null,"work_id":"8aa7dcba-7568-4e0d-8a56-619c1cbc73ca","year":2024},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.837623Z"},"links":{"citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:e2c05bc33e3bee54287dbb6525cc3a714da4b023a75b3504d0d22e2fe9141741","observation_id":"39034598-b7e8-44b1-a69c-6b5c30bdb504","resolution":{"observed_at":"2026-08-08T16:36:01.676982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:36:00.842255Z","title":"S., Kim, G.-W., Kim, S., and Chun, B.-G","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.842255Z"},"links":{"citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:4687bd7df03306b5337c72d37a52d902ff7770e9c8a7b62be2502a7d34202d86","observation_id":"8725a39c-57b3-4256-a970-bc42a964c472","resolution":{"observed_at":"2026-08-08T16:36:00.842255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:36:01.644828Z","title":"Q-hitter: A better token oracle for efficient llm inference via sparse-quantized kv cache","venue":null,"work_id":"b71ab6fc-f2ef-4eb1-8c67-41ced13edccd","year":2024},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.846932Z"},"links":{"citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:12ee01d09f4102fbd8fff2ff1fd375f7440d9d8f256cc22a13e6ab9ef58f1366","observation_id":"3ae35f44-79de-4022-a59b-27ccad8757b2","resolution":{"observed_at":"2026-08-08T16:36:01.649692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:36:01.628836Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models","venue":null,"work_id":"41ea9009-b5e4-46f1-a88c-86c167323b2e","year":2024},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.851818Z"},"links":{"citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:00668fb1132031b889fcaa9bf367bcf0881862e929fe8c2535f7aeea94173461","observation_id":"f39a16b3-dd90-4c9b-967d-e44aa98714ae","resolution":{"observed_at":"2026-08-08T16:36:01.634544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12588","last_updated":"2025-02-27T07:00:30Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T17:54:21Z","title":"Real-Time Video Generation with Pyramid Attention Broadcast","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12588","snapshot_observed_at":"2026-08-08T16:36:00.856578Z","title":"Real-time video generation with pyramid attention broadcast","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.856578Z"},"links":{"cited_paper":"/paper/2408.12588","citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:e3e4454f915f81d39e0af12a30c76db38fd4859c2799a82f65cc80230ea7cb10","observation_id":"66cc62c7-cdbc-4ebc-a43a-82c162f99ce3","resolution":{"observed_at":"2026-08-08T16:36:00.856578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:36:01.613263Z","title":"Open-sora: Democratizing efficient video production for all, March 2024","venue":null,"work_id":"221cca1e-93a3-4643-94a8-52e59ed54929","year":2024},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.861663Z"},"links":{"citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:821b37f62214a0b5bad18a296afb7971b8dee27a06b29b2c6c0ab94ba81b3833","observation_id":"02022250-effe-41ba-b5b2-f5ebfd8b6a11","resolution":{"observed_at":"2026-08-08T16:36:01.618102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":2,"verified_fuzzy":18},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 9 inbound Pith citation observations for arXiv:2502.06155."}