{"as_of":"2026-08-01T12:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ed2cbea000645250d99461555f79648dc1a14475f112cdce40d0346242d54253","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T07:09:10.589942Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-01T06:32:01.292127+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.21553/citation-record","integrity":"/paper/2607.21553/integrity","json":"/paper/2607.21553/citation-record.json","paper":"/paper/2607.21553"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-01T07:09:04.165440Z","title":"Cosmos 3: Omnimodal world models for physical ai.arXiv preprint arXiv:2606.02800, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:04.165440Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:2dc1ae19db0c7f2d0cf6b2641e2e04f20f2874469079a52da61dff09be2638cc","observation_id":"1b1e1ac5-9340-47c9-9240-c51e842ff138","resolution":{"observed_at":"2026-08-01T07:09:04.165440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:09:04.210677Z","title":"Simple Linear Attention Language Models Balance the Recall-Throughput Tradeoff","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:04.210677Z"},"links":{"citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:977ebc2de2af95ff2455c5984c3d3843b86d7ef0a48e555352631ce388bbcb2c","observation_id":"cbcb147a-5dfb-477b-ace1-7a7c0e394126","resolution":{"observed_at":"2026-08-01T07:09:04.210677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.22344","last_updated":"2026-05-21T11:30:29Z","snapshot_observed_at":"2026-07-06T23:32:39.761431Z","submitted_at":"2026-05-21T11:30:29Z","title":"Bernini: Latent Semantic Planning for Video Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.22344","snapshot_observed_at":"2026-08-01T07:09:04.295403Z","title":"Bernini: Latent Semantic Planning for Video Diffusion","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:04.295403Z"},"links":{"cited_paper":"/paper/2605.22344","citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:c7a114b46c313e3f424dcf36847615b03b05f5d7622631f56724dda55aada251","observation_id":"19d8d957-ddf4-4adb-a4e4-6a5fc2817c4b","resolution":{"observed_at":"2026-08-01T07:09:04.295403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:09:04.408160Z","title":"UniPercept: Towards Unified Perceptual-Level Image Understanding across Aesthetics, Quality, Structure, and Texture","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:04.408160Z"},"links":{"citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:3c5c7784592a5a2bcf58df70c057dc28203a754a97834d3aa07aaeda5a6f411f","observation_id":"73899bf4-96e4-450c-b1a2-0d5e30f248c9","resolution":{"observed_at":"2026-08-01T07:09:04.408160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:09:04.542402Z","title":"Self-Supervised Flow Matching for Scalable Multi-Modal Synthesis","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:04.542402Z"},"links":{"citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:84d0f38a1e52d51adffe8b4f2911bb1f19617f7ac6343c680e713377686d8354","observation_id":"d2c70687-a060-4975-9f38-cccde0324b59","resolution":{"observed_at":"2026-08-01T07:09:04.542402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:09:04.684694Z","title":"SANA-Video: Efficient Video Generation with Block Linear Diffusion Transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:04.684694Z"},"links":{"citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:67343e5b183fd53339da4e9aba5e4401bc1132d4ccaaa3c624588a8d3c253dfc","observation_id":"082ea584-5be5-4446-9ef3-89016abe5e69","resolution":{"observed_at":"2026-08-01T07:09:04.684694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:09:04.828094Z","title":"Breaking the Low-Rank Dilemma of Linear Attention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:04.828094Z"},"links":{"citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:88cba1b819987f11ea47af2b7cf801c6b55213fa4db46b42f877f260cbe9d080","observation_id":"9b61acad-4356-4f24-abae-18cbd0c4f276","resolution":{"observed_at":"2026-08-01T07:09:04.828094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-01T07:09:04.934288Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:04.934288Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:a203c175f8a292267924942a4e92590979e28b129bcd3e5daa5c155bb6b8361a","observation_id":"ef5954d5-8d0e-4d5c-8c8d-8cea12cb2f78","resolution":{"observed_at":"2026-08-01T07:09:04.934288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:09:05.084210Z","title":"Attention Surgery: An Efficient Recipe to Linearize Your Video Diffusion Transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:05.084210Z"},"links":{"citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:34c6f179c9373b68e71bf11ca55050008694695830afff6f94c5f52d9ce79e34","observation_id":"a052d4ae-dd25-40af-9300-421992159c62","resolution":{"observed_at":"2026-08-01T07:09:05.084210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:09:05.188820Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:05.188820Z"},"links":{"citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:ea1d24e73ac9ffe270e8033e2edb30a3798b3e17c7fc58baeadc75c7261f4cda","observation_id":"83e788a5-4197-45ad-b62f-15d98788b0d2","resolution":{"observed_at":"2026-08-01T07:09:05.188820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-08-01T07:09:05.305026Z","title":"LTX-Video: Realtime Video Latent Diffusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:05.305026Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:98f6ca1a30b925ab351fa1725413433ec43ebcb8e20bc9c866e5f15f86c8c497","observation_id":"f9872eb2-77b7-401c-99be-2203668466c1","resolution":{"observed_at":"2026-08-01T07:09:05.305026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:09:05.421147Z","title":"VBench: Comprehensive Benchmark Suite for Video Generative Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:05.421147Z"},"links":{"citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:cee153eb30c72baab216dfb3bb73ae782c88fab4f841be2e0904fca695ed7614","observation_id":"9996f1d9-74bc-4cfa-bf1f-f29249bb040f","resolution":{"observed_at":"2026-08-01T07:09:05.421147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:09:05.517153Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:05.517153Z"},"links":{"citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:b5ec220b19ab7036bb07b456c5fe9bc00a44449c53dad540a0af180e8627a7d4","observation_id":"f800d22a-e588-4f25-ba32-62d101f1e751","resolution":{"observed_at":"2026-08-01T07:09:05.517153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-08-01T07:09:05.662964Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:05.662964Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:b1801ade8352aaa6b7d1907769f5ed3277781e0f51e2a11d37eaf7a81b24db94","observation_id":"d3fed15d-513b-4eb8-acb4-9120230e8599","resolution":{"observed_at":"2026-08-01T07:09:05.662964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:09:05.821367Z","title":"Kimi K3: Open Frontier Intelligence","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:05.821367Z"},"links":{"citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:e5b6baba9217ebf969f142b8d9b907669ee7e706e42c694c89bbe1d74260c12f","observation_id":"5ef96763-d99f-4034-94c4-9aaf620025be","resolution":{"observed_at":"2026-08-01T07:09:05.821367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-08-01T07:09:05.956746Z","title":"Attention Residuals","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:05.956746Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:98161b103db7a1d8fa02d982a0d61ead5f2cdf8b2844102583967dadbbed1bfb","observation_id":"022e5892-adbc-4a92-9637-75959bf95652","resolution":{"observed_at":"2026-08-01T07:09:05.956746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-01T07:09:06.066938Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:06.066938Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:9a8fc71e21128a35dfbd648dbd48958d3766bba4a6849922ac2ee833ff4a2f9a","observation_id":"c9ca3f93-369e-4c1e-8150-804e07b3b727","resolution":{"observed_at":"2026-08-01T07:09:06.066938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:09:06.173473Z","title":"PISA: Piecewise Sparse Attention Is Wiser for Efficient Diffusion Transformers","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:06.173473Z"},"links":{"citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:a94a9326a33df0b6ca22925614e827c9a38e055afac2999720b7c3c516439805","observation_id":"9a203054-2a57-4b2d-bf8e-d8f943ac781b","resolution":{"observed_at":"2026-08-01T07:09:06.173473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:09:06.301385Z","title":"VideoMamba: State Space Model for Efficient Video Understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:06.301385Z"},"links":{"citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:99c33c75c051604355e1b01cc6e2052c03cea7d05d260f156638a4f6347eca4f","observation_id":"e72ad94b-33b6-4ffe-8d0f-ea30a0ce162e","resolution":{"observed_at":"2026-08-01T07:09:06.301385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:09:06.452147Z","title":"Radial Attention: 𝑂(𝑛log𝑛) Sparse Attention with Energy Decay for Long Video Generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:06.452147Z"},"links":{"citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:2a48185e3d7cd0caa63688c371716b198385877c967826f355b1b96d55debbec","observation_id":"ada065ee-a314-427c-a7e2-ad15f2412de9","resolution":{"observed_at":"2026-08-01T07:09:06.452147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.23743","last_updated":"2026-06-24T14:59:15Z","snapshot_observed_at":"2026-07-06T23:58:25.400508Z","submitted_at":"2026-06-21T17:23:20Z","title":"Sol Video Inference Engine: Agent-Native Full-Stack Acceleration Framework for Efficient Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.23743","snapshot_observed_at":"2026-08-01T07:09:06.585681Z","title":"Sol Video Inference Engine: Agent-Native Full-Stack Acceleration Framework for Efficient Video Generation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:06.585681Z"},"links":{"cited_paper":"/paper/2606.23743","citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:89a2cd772b57d38ef2a28c204e8fdfe383de790c08f1568ac71c5c9b1a0fd262","observation_id":"d840381f-f287-40b2-94af-15806ed26d88","resolution":{"observed_at":"2026-08-01T07:09:06.585681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:09:06.696742Z","title":"Toward A Prac- tical Perceptual Video Quality Metric","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:06.696742Z"},"links":{"citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:24c089c95c8e9e9732d9e734b997fe983e09c4d692ef31c5fd33feb792875c5a","observation_id":"6b267aca-3c10-4a8a-b317-02f155a496f4","resolution":{"observed_at":"2026-08-01T07:09:06.696742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:09:06.815351Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:06.815351Z"},"links":{"citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:160df7729236613e13daa6ca138b72fe81f1202ab50a4584c627974c369640f9","observation_id":"c5fd60a1-ef5c-4b34-ae1e-d24eddf3b9d8","resolution":{"observed_at":"2026-08-01T07:09:06.815351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:09:06.929517Z","title":"HPSv3++: Scaling Reward Models Across the Full Spectrum of Diffusion Model Capabilities","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:06.929517Z"},"links":{"citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:dd43ae7b0da4af5d3080440da96d869519e54e9c0cd4cf642ae91e514be31277","observation_id":"51d1d801-8c1e-49db-a11c-4c54f1947083","resolution":{"observed_at":"2026-08-01T07:09:06.929517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:09:07.057918Z","title":"VMamba: Visual State Space Model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:07.057918Z"},"links":{"citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:97d9958254617f48bb01c6e5f06680b98a82a77c19f87acba97407fcc46d0da7","observation_id":"3e02b234-06f3-4820-8891-4dc30a4d5f13","resolution":{"observed_at":"2026-08-01T07:09:07.057918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:09:07.203444Z","title":"Beyond the Golden Data: Resolving the Motion-Vision Quality Dilemma via Timestep Selective Training","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:07.203444Z"},"links":{"citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:83d698513434e063837c1cf6f4d7c8ee7cdda35794cdce7b576197e9ad178e29","observation_id":"887082f7-fe31-4548-837c-3e0827a0d247","resolution":{"observed_at":"2026-08-01T07:09:07.203444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-07-11T23:20:19.799297Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.07675","snapshot_observed_at":"2026-08-01T07:09:07.343135Z","title":"Scaling mixture-of-experts video pretraining for embodied intelligence.arXiv preprint arXiv:2607.07675, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:07.343135Z"},"links":{"cited_paper":"/paper/2607.07675","citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:b8afa3c01eb7523312a849fca04630828e5ddb6070747cd6f22a4382daff5d80","observation_id":"2119e194-4fbd-4a60-b3f8-fc2cb5f98de2","resolution":{"observed_at":"2026-08-01T07:09:07.343135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:09:07.456884Z","title":"Scalable Diffusion Models with Transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:07.456884Z"},"links":{"citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:84b0c9cd6e11c1c2b03f638e6d1520945bd8189467566ffcebd5bbe21e8ae4b2","observation_id":"66c7c2a2-659e-4565-89fe-d6d83a225b28","resolution":{"observed_at":"2026-08-01T07:09:07.456884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-01T07:09:07.598100Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:07.598100Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:f85fb01528e42d12f79e10cf8f3f362f36f67fcd4ddc4ac719fcc919ca9425ba","observation_id":"cced871c-cbd8-48f4-bf59-aee4cac671e4","resolution":{"observed_at":"2026-08-01T07:09:07.598100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:09:07.715164Z","title":"Qwen3-Next: Towards Ultimate Training & Inference Efficiency","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:07.715164Z"},"links":{"citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:c531b16b9b34964468e39fc9054e92fe1b51fd7fadb1eed27e09c0fc59923a49","observation_id":"999d7a27-f956-4b8d-bfc8-10436d5d4cbd","resolution":{"observed_at":"2026-08-01T07:09:07.715164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13211","last_updated":"2025-05-19T14:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-19T14:58:50Z","title":"MAGI-1: Autoregressive Video Generation at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13211","snapshot_observed_at":"2026-08-01T07:09:07.832039Z","title":"MAGI-1: Autoregressive Video Generation at Scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:07.832039Z"},"links":{"cited_paper":"/paper/2505.13211","citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:e81987402eea90c1a044d2367d70673ba3da855d5afb7720c2b2cdef2106fbbf","observation_id":"f604e2e5-8fec-46e6-b833-afdcf770b5f4","resolution":{"observed_at":"2026-08-01T07:09:07.832039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14148","last_updated":"2026-04-15T17:59:40Z","snapshot_observed_at":"2026-07-06T23:02:00.082783Z","submitted_at":"2026-04-15T17:59:40Z","title":"Seedance 2.0: Advancing Video Generation for World Complexity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.14148","snapshot_observed_at":"2026-08-01T07:09:07.970233Z","title":"Seedance 2.0: Advancing Video Generation for World Complexity","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:07.970233Z"},"links":{"cited_paper":"/paper/2604.14148","citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:1dcbe24a779e8bb74b926af921e31afea75b36e2c4ff2b3d20cc913050157124","observation_id":"b73745d6-0306-48bd-b60a-eaca92f8ca2e","resolution":{"observed_at":"2026-08-01T07:09:07.970233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.04838","last_updated":"2020-08-11T16:37:59Z","snapshot_observed_at":"2026-07-06T09:46:20.126340Z","submitted_at":"2020-08-11T16:37:59Z","title":"TransNet V2: An effective deep network architecture for fast shot transition detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.04838","snapshot_observed_at":"2026-08-01T07:09:08.081225Z","title":"TransNet V2: An Effective Deep Network Architecture for Fast Shot Transition Detection","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:08.081225Z"},"links":{"cited_paper":"/paper/2008.04838","citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:2bd99f4cd91f511715b37000341414d3d1d53222160a92024de626c532186276","observation_id":"640c4dcc-79f7-46cf-b6cf-7c238bbc1559","resolution":{"observed_at":"2026-08-01T07:09:08.081225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:09:08.266614Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding.Neurocomputing, 568:127063, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:08.266614Z"},"links":{"citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:f55475b128d95d3bb0dd647ff4413482a871f8e9c891a1fe6c8d286ff5d9166b","observation_id":"1b8fee61-361d-430c-90d0-733631c88fea","resolution":{"observed_at":"2026-08-01T07:09:08.266614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14224","last_updated":"2024-07-10T09:02:11Z","snapshot_observed_at":"2026-07-06T18:18:21.334080Z","submitted_at":"2024-05-23T06:53:18Z","title":"DiM: Diffusion Mamba for Efficient High-Resolution Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14224","snapshot_observed_at":"2026-08-01T07:09:08.398370Z","title":"DiM: Diffusion Mamba for Efficient High-Resolution Image Synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:08.398370Z"},"links":{"cited_paper":"/paper/2405.14224","citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:ad2e06ef6f0608719d7ea1443e4f38800f00682bc716711b6365ee2646c1dea1","observation_id":"fd2842a6-f9b5-4354-aa62-8f3e9b4e5626","resolution":{"observed_at":"2026-08-01T07:09:08.398370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:09:08.542920Z","title":"Diffusion Model Alignment Using Direct Preference Optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:08.542920Z"},"links":{"citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:94bd794f0349c2d9367170c3cba009fcf2da22da31bded13f5abf0ae0438421a","observation_id":"f250d9a7-6ee0-4c57-b19a-8015c93c36cc","resolution":{"observed_at":"2026-08-01T07:09:08.542920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:09:08.630618Z","title":"Wan2.2: Open and Advanced Large-Scale Video Generative Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:08.630618Z"},"links":{"citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:bd8c66faa4af9460c47b0f7dad23b34d50ae4cf831dae83828c38437d3a0d389","observation_id":"44ca3871-0407-4b82-9035-bb26fe2bbc1d","resolution":{"observed_at":"2026-08-01T07:09:08.630618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-01T07:09:08.710736Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:08.710736Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:e9e9fca8825ca73adb3ae7ff7a2c7eb3ed2468827785bb2b7f452c9629bb37a0","observation_id":"58cd1b90-7d58-4106-b8f4-44bbaad2dd34","resolution":{"observed_at":"2026-08-01T07:09:08.710736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:09:08.848484Z","title":"Exploring Video Quality Assessment on User Generated Contents from Aesthetic and Technical Perspectives","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:08.848484Z"},"links":{"citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:064e2ad7e542c289b1f36aa77ed2beaa34fe259baa8fe5752fae0882f31f26e8","observation_id":"61bbe66a-4ef4-4dcc-be18-67897e00162d","resolution":{"observed_at":"2026-08-01T07:09:08.848484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01776","last_updated":"2025-04-27T00:10:11Z","snapshot_observed_at":"2026-07-06T20:30:31.588538Z","submitted_at":"2025-02-03T19:29:16Z","title":"Sparse VideoGen: Accelerating Video Diffusion Transformers with Spatial-Temporal Sparsity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01776","snapshot_observed_at":"2026-08-01T07:09:08.982968Z","title":"Sparse VideoGen: Accelerating Video Diffusion Transformers with Spatial-Temporal Sparsity","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:08.982968Z"},"links":{"cited_paper":"/paper/2502.01776","citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:bed3fb17805288ad730018d7994540e15f772b99689d24c6b0dab47c42d220a0","observation_id":"9653e097-2e9c-4e36-a90a-2cbb82949270","resolution":{"observed_at":"2026-08-01T07:09:08.982968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:09:09.153544Z","title":"Unifying Flow, Stereo and Depth Estimation.IEEE Transactions on Pattern Analysis and Machine Intelligence, 45(11): 13941–13958, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:09.153544Z"},"links":{"citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:cad3e1f12c59e6ec30914b28adbcc7ecfc780983cfe32b269c0375f69dd6ef4f","observation_id":"54b66d7c-87ba-4a79-af70-eb4703016be7","resolution":{"observed_at":"2026-08-01T07:09:09.153544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:09:09.259598Z","title":"ImageRe- ward: Learning and Evaluating Human Preferences for Text-to-Image Generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:09.259598Z"},"links":{"citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:346b419d4f1abf6f3016ed9637f4984bc8cd80b1b12004c281a79f221505360d","observation_id":"64856d84-6dcd-4441-8e23-464b8cd55285","resolution":{"observed_at":"2026-08-01T07:09:09.259598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:09:09.367772Z","title":"Gated Linear Attention Transformers with Hardware-Efficient Training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:09.367772Z"},"links":{"citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:3195a2d697d34cce8e3f1205f260a961fbefcd19d96a76d090948285b16df5ab","observation_id":"110fe622-34d5-4823-9dc4-28cc3066df91","resolution":{"observed_at":"2026-08-01T07:09:09.367772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:09:09.504622Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:09.504622Z"},"links":{"citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:ffc28f4591b9201b50afd61eb6c4089defc8af1f4c9254396935978e93b5c5a4","observation_id":"ae2c8a2a-1f1c-45cf-a701-a40ac93977ab","resolution":{"observed_at":"2026-08-01T07:09:09.504622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:09:09.627087Z","title":"Teaching Large Language Models to Regress Accurate Image Quality Scores Using Score Distribution","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:09.627087Z"},"links":{"citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:403cfbef38e3efbd5d9f61814423a53465ca8f80e39199b03baa81ced37223c3","observation_id":"42e049af-2592-4825-8dc4-ec39913eac64","resolution":{"observed_at":"2026-08-01T07:09:09.627087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11089","last_updated":"2025-02-27T09:01:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-16T11:53:44Z","title":"Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11089","snapshot_observed_at":"2026-08-01T07:09:09.744027Z","title":"Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:09.744027Z"},"links":{"cited_paper":"/paper/2502.11089","citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:4bc3e98e4d45b218b7c7c25e339f322944b8bd4fdf64b713ccd6037027947b52","observation_id":"53766f05-37c6-4596-bbab-07456923d508","resolution":{"observed_at":"2026-08-01T07:09:09.744027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:09:09.905050Z","title":"Sigmoid Loss for Language Image Pre-Training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:09.905050Z"},"links":{"citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:99ac54b16e8d274d852608805ed4de1e9dd1739dc0a31683ba1d83f84a002e07","observation_id":"e918a28b-d180-4ba4-9e46-985de5cee056","resolution":{"observed_at":"2026-08-01T07:09:09.905050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:09:10.076055Z","title":"SpargeAttention: Accurate and Training-free Sparse Attention Accelerating Any Model Inference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:10.076055Z"},"links":{"citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:af834d246732abf767608c4ddb5236a3e630e545c55f926ed5447c34003f32b1","observation_id":"6c359b24-7a7b-42ff-9b5c-c1796c5181d0","resolution":{"observed_at":"2026-08-01T07:09:10.076055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.30409","last_updated":"2026-05-28T17:59:17Z","snapshot_observed_at":"2026-07-06T23:39:43.967889Z","submitted_at":"2026-05-28T17:59:17Z","title":"SANA-Streaming: Real-time Streaming Video Editing with Hybrid Diffusion Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.30409","snapshot_observed_at":"2026-08-01T07:09:10.254223Z","title":"SANA-Streaming: Real-time Streaming Video Editing with Hybrid Diffusion Transformer","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:10.254223Z"},"links":{"cited_paper":"/paper/2605.30409","citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:f500f051f11a9b7195db8f38b6f803baee2751f8c035966d4edc58a0a712f7df","observation_id":"5537ff05-11a8-416a-bb93-5fef02adcac6","resolution":{"observed_at":"2026-08-01T07:09:10.254223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09642","last_updated":"2026-03-02T11:31:23Z","snapshot_observed_at":"2026-07-30T09:26:11.145371Z","submitted_at":"2025-03-12T05:00:07Z","title":"Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09642","snapshot_observed_at":"2026-08-01T07:09:10.371272Z","title":"Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:10.371272Z"},"links":{"cited_paper":"/paper/2503.09642","citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:2c90ab5c733399d176c82cb28072348291208b8cd4b5c970ab109b1ab4bd949e","observation_id":"9f939f6d-c5fb-4c6e-92dd-4cef37750e66","resolution":{"observed_at":"2026-08-01T07:09:10.371272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.15178","last_updated":"2026-05-14T17:58:03Z","snapshot_observed_at":"2026-07-06T23:26:32.979566Z","submitted_at":"2026-05-14T17:58:03Z","title":"SANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.15178","snapshot_observed_at":"2026-08-01T07:09:10.471087Z","title":"SANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformer","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:10.471087Z"},"links":{"cited_paper":"/paper/2605.15178","citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:85670b9cc717d4b830b264779d43cd6aecc794b678d9d47c0397d842f01de35c","observation_id":"147a1451-2749-4bef-9a9f-1f90c6b49484","resolution":{"observed_at":"2026-08-01T07:09:10.471087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:09:10.589942Z","title":"DiG: Scalable and Efficient Diffusion Models with Gated Linear Attention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:10.589942Z"},"links":{"citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:b0372999ef0f278450f75c404d2719652ff133343ff7f510ae6ea02d189df27e","observation_id":"c70410cd-7a54-425b-89bc-1f033054650b","resolution":{"observed_at":"2026-08-01T07:09:10.589942Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-01T07:09:02.313495Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"thesis":"As of 1 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2607.21553."}