{"as_of":"2026-08-11T11:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:154bc6a0fd59dace06116362b353af415a01305db0148939232b45841312e0d2","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T02:45:10.577070Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T01:52:14.874049Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-15T01:53:28.740566Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.19473","last_updated":"2026-04-21T13:56:36Z","snapshot_observed_at":"2026-08-11T10:18:22.825892Z","submitted_at":"2026-04-21T13:56:36Z","title":"TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation","version":1},"cited_work":{"arxiv_id":"2604.19473","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.19473","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation","venue":"cs.CV","work_id":"861de897-039d-414e-a402-a061ccf5af12","year":2026},"citing_paper":{"arxiv_id":"2605.14382","last_updated":"2026-08-10T06:39:43Z","snapshot_observed_at":"2026-08-11T11:21:33.063679Z","submitted_at":"2026-05-14T05:06:57Z","title":"Delta Forcing: Trust Region Steering for Interactive Autoregressive Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-15T01:52:14.874049Z"},"links":{"cited_paper":"/paper/2604.19473","citing_paper":"/paper/2605.14382"},"observation_digest":"sha256:7628424b468f66b3dcbcce17066b8e4a8a0469bcf283348ed50dd0b947cba0ab","observation_id":"ea3d4ba2-8682-4ae4-b034-0258bf30f9f5","resolution":{"observed_at":"2026-05-15T01:53:28.741906Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2604.19473/citation-record","integrity":"/paper/2604.19473/integrity","json":"/paper/2604.19473/citation-record.json","paper":"/paper/2604.19473"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.04682","last_updated":"2024-11-08T05:45:45Z","snapshot_observed_at":"2026-08-10T11:36:21.520898Z","submitted_at":"2024-05-07T21:52:39Z","title":"TALC: Time-Aligned Captions for Multi-Scene Text-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2405.04682","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04682","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Talc: Time-aligned captions for multi-scene text-to-video generation","venue":null,"work_id":"bb200c5c-fb1b-4687-8d72-1f391c46e4db","year":2024},"citing_paper":{"arxiv_id":"2604.19473","last_updated":"2026-04-21T13:56:36Z","snapshot_observed_at":"2026-08-11T10:18:22.825892Z","submitted_at":"2026-04-21T13:56:36Z","title":"TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T02:45:10.577070Z"},"links":{"cited_paper":"/paper/2405.04682","citing_paper":"/paper/2604.19473"},"observation_digest":"sha256:e30e202713bd0bb92f68942f68340447be671ec3af51716a3d345641f657d0ee","observation_id":"cdde0bd5-d641-4a8c-bfaa-0d05ea1d7fb5","resolution":{"observed_at":"2026-05-10T02:53:29.905801Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13074","last_updated":"2025-04-21T10:34:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-17T16:37:27Z","title":"SkyReels-V2: Infinite-length Film Generative Model","version":3},"cited_work":{"arxiv_id":"2504.13074","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.13074","snapshot_observed_at":"2026-07-10T01:46:41.058772Z","title":"SkyReels-V2: Infinite-length Film Generative Model","venue":"cs.CV","work_id":"2ce11350-273e-4f0d-ae78-292aa3151060","year":2025},"citing_paper":{"arxiv_id":"2604.19473","last_updated":"2026-04-21T13:56:36Z","snapshot_observed_at":"2026-08-11T10:18:22.825892Z","submitted_at":"2026-04-21T13:56:36Z","title":"TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T02:45:10.577070Z"},"links":{"cited_paper":"/paper/2504.13074","citing_paper":"/paper/2604.19473"},"observation_digest":"sha256:b8c44338492e483b8ef00146e798a5211521f47401e5ef6ba3944252ae1696ba","observation_id":"e3723677-5e7a-466c-b7cb-8ddf88060a44","resolution":{"observed_at":"2026-05-14T20:23:04.486750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09047","last_updated":"2024-01-17T08:30:32Z","snapshot_observed_at":"2026-08-04T07:40:19.403363Z","submitted_at":"2024-01-17T08:30:32Z","title":"VideoCrafter2: Overcoming Data Limitations for High-Quality Video Diffusion Models","version":1},"cited_work":{"arxiv_id":"2401.09047","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.09047","snapshot_observed_at":"2026-06-28T20:42:37.758214Z","title":"Videocrafter2: Overcoming data limita- tions for high-quality video diffusion models","venue":null,"work_id":"8c2c1d92-75e1-4574-929f-379bc5317044","year":2024},"citing_paper":{"arxiv_id":"2604.19473","last_updated":"2026-04-21T13:56:36Z","snapshot_observed_at":"2026-08-11T10:18:22.825892Z","submitted_at":"2026-04-21T13:56:36Z","title":"TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T02:45:10.577070Z"},"links":{"cited_paper":"/paper/2401.09047","citing_paper":"/paper/2604.19473"},"observation_digest":"sha256:dc8044a19e4c64790dddf3d1cdfbafdbcf0b8da315e8cc5d0d6fde1d5cd3966e","observation_id":"41c64761-3b6b-4330-9bf9-988ed60ec2d6","resolution":{"observed_at":"2026-05-10T02:53:29.915192Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10391","last_updated":"2025-03-13T14:07:58Z","snapshot_observed_at":"2026-08-10T20:05:46.553386Z","submitted_at":"2025-03-13T14:07:58Z","title":"CINEMA: Coherent Multi-Subject Video Generation via MLLM-Based Guidance","version":1},"cited_work":{"arxiv_id":"2503.10391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10391","snapshot_observed_at":"2026-07-04T21:10:09.682483Z","title":"Cinema: Coherent multi-subject video generation via mllm-based guidance","venue":null,"work_id":"1820a399-b3ca-48c7-aaf0-dd2a7dff2e4b","year":2025},"citing_paper":{"arxiv_id":"2604.19473","last_updated":"2026-04-21T13:56:36Z","snapshot_observed_at":"2026-08-11T10:18:22.825892Z","submitted_at":"2026-04-21T13:56:36Z","title":"TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T02:45:10.577070Z"},"links":{"cited_paper":"/paper/2503.10391","citing_paper":"/paper/2604.19473"},"observation_digest":"sha256:f68b5b3618ce9cf97d535357ea45dac9cd88de07565b9a4f1db4e49b03223a6b","observation_id":"a6452147-1bd9-46b1-b879-ee5b15d83f5b","resolution":{"observed_at":"2026-05-10T02:53:29.912925Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08453","last_updated":"2025-01-14T21:53:11Z","snapshot_observed_at":"2026-08-10T20:23:52.962610Z","submitted_at":"2025-01-14T21:53:11Z","title":"Vchitect-2.0: Parallel Transformer for Scaling Up Video Diffusion Models","version":1},"cited_work":{"arxiv_id":"2501.08453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.08453","snapshot_observed_at":"2026-07-04T13:19:51.141627Z","title":"Vchitect-2.0: Parallel transformer for scaling up video diffusion models.arXiv preprint arXiv:2501.08453","venue":null,"work_id":"4bed9bae-f24a-4316-9d52-06cda3f3fcd7","year":2025},"citing_paper":{"arxiv_id":"2604.19473","last_updated":"2026-04-21T13:56:36Z","snapshot_observed_at":"2026-08-11T10:18:22.825892Z","submitted_at":"2026-04-21T13:56:36Z","title":"TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T02:45:10.577070Z"},"links":{"cited_paper":"/paper/2501.08453","citing_paper":"/paper/2604.19473"},"observation_digest":"sha256:b989ce11f522c1ba1b2c67a19768933d52392268bfa635e11b32b1faf7118290","observation_id":"1f880598-6788-4466-8203-a223b55a83ae","resolution":{"observed_at":"2026-05-10T02:53:29.919945Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"I2v-adapter: A general image-to-video adapter for diffusion models","venue":null,"work_id":"6cfb44a1-61f1-41a9-9ffb-e60ec532faef","year":2024},"citing_paper":{"arxiv_id":"2604.19473","last_updated":"2026-04-21T13:56:36Z","snapshot_observed_at":"2026-08-11T10:18:22.825892Z","submitted_at":"2026-04-21T13:56:36Z","title":"TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T02:45:10.577070Z"},"links":{"citing_paper":"/paper/2604.19473"},"observation_digest":"sha256:67092c6cf70d833c1c5bf800df5dd50b3c44aaf6f33962696ca50c74628a67be","observation_id":"9ced2ea6-9867-401f-a814-493c6c86721a","resolution":{"observed_at":"2026-05-22T19:37:01.540880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":"2501.00103","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-07-09T07:56:04.699528Z","title":"LTX-Video: Realtime Video Latent Diffusion","venue":"cs.CV","work_id":"cee5c521-3ce9-466e-a035-1e42f89254f4","year":2024},"citing_paper":{"arxiv_id":"2604.19473","last_updated":"2026-04-21T13:56:36Z","snapshot_observed_at":"2026-08-11T10:18:22.825892Z","submitted_at":"2026-04-21T13:56:36Z","title":"TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T02:45:10.577070Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2604.19473"},"observation_digest":"sha256:d3d865213576cd4a3873f23fa1f947531efefaf0e5b8f554742d0dfc6095670c","observation_id":"d78a4c90-b8cd-4a0c-9c6b-8605e9222a88","resolution":{"observed_at":"2026-05-11T10:36:12.849504Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hailuo.https://hailuoai.video/","venue":null,"work_id":"072c5e71-5952-4c03-9292-86dacad09960","year":2026},"citing_paper":{"arxiv_id":"2604.19473","last_updated":"2026-04-21T13:56:36Z","snapshot_observed_at":"2026-08-11T10:18:22.825892Z","submitted_at":"2026-04-21T13:56:36Z","title":"TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T02:45:10.577070Z"},"links":{"citing_paper":"/paper/2604.19473"},"observation_digest":"sha256:884aecb521ac6d399329cfe000a8fd3b192a8b03de6de9c9a73862c7ea393404","observation_id":"96d0743c-6afa-47d6-8b75-e84bd5c558fb","resolution":{"observed_at":"2026-05-22T19:37:01.542672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-09T05:21:16.525940Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"cited_work":{"arxiv_id":"2502.04320","doi":"10.48550/arxiv.2502.04320","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04320","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Con- ceptattention: Diffusion transformers learn highly inter- pretable features","venue":"ArXiv.org","work_id":"f5715b3d-4e8a-459a-b8b2-901eb2f0fe8e","year":2025},"citing_paper":{"arxiv_id":"2604.19473","last_updated":"2026-04-21T13:56:36Z","snapshot_observed_at":"2026-08-11T10:18:22.825892Z","submitted_at":"2026-04-21T13:56:36Z","title":"TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T02:45:10.577070Z"},"links":{"cited_paper":"/paper/2502.04320","citing_paper":"/paper/2604.19473"},"observation_digest":"sha256:2e944bb38bb2f5ab57fb2b59c5362e052a564ff560e50b1dc52bc4e39a9a4093","observation_id":"014dd85b-2817-4cc2-be1c-e2a8fccbdcff","resolution":{"observed_at":"2026-05-10T02:53:29.908134Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":"2505.04512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-07-04T21:10:09.669744Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video generation","venue":null,"work_id":"206c3d53-d8c1-441e-a421-19e52b8080c4","year":2025},"citing_paper":{"arxiv_id":"2604.19473","last_updated":"2026-04-21T13:56:36Z","snapshot_observed_at":"2026-08-11T10:18:22.825892Z","submitted_at":"2026-04-21T13:56:36Z","title":"TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T02:45:10.577070Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2604.19473"},"observation_digest":"sha256:a9cf89790bf888cb5d651f94ea4b12fc27be6b87072f99fd09d8d691f41e7c31","observation_id":"65333d83-84de-4bec-87d3-da71d12a5d45","resolution":{"observed_at":"2026-05-10T02:53:29.903427Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08605","last_updated":"2025-03-11T16:43:45Z","snapshot_observed_at":"2026-08-07T17:12:25.713576Z","submitted_at":"2025-03-11T16:43:45Z","title":"Tuning-Free Multi-Event Long Video Generation via Synchronized Coupled Sampling","version":1},"cited_work":{"arxiv_id":"2503.08605","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.08605","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tuning- free multi-event long video generation via synchronized coupled sampling.arXiv preprint arXiv:2503.08605","venue":null,"work_id":"4110c58c-b96c-4876-8a9b-348a60e09d74","year":null},"citing_paper":{"arxiv_id":"2604.19473","last_updated":"2026-04-21T13:56:36Z","snapshot_observed_at":"2026-08-11T10:18:22.825892Z","submitted_at":"2026-04-21T13:56:36Z","title":"TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T02:45:10.577070Z"},"links":{"cited_paper":"/paper/2503.08605","citing_paper":"/paper/2604.19473"},"observation_digest":"sha256:9ce546f65cf988c59ddc135f8f02ebbbe35365875c401e615f64754643fc95cf","observation_id":"012f6468-cda6-44dc-b980-755992f6f31b","resolution":{"observed_at":"2026-05-10T02:53:29.924663Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2604.19473","last_updated":"2026-04-21T13:56:36Z","snapshot_observed_at":"2026-08-11T10:18:22.825892Z","submitted_at":"2026-04-21T13:56:36Z","title":"TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T02:45:10.577070Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2604.19473"},"observation_digest":"sha256:364dfbdf2062aa498326cef119139bcd530f09680b8f7dc3c426b645d655d49c","observation_id":"09e337e9-9e14-4424-b69c-ba81df138223","resolution":{"observed_at":"2026-05-10T02:53:29.910521Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2604.19473","last_updated":"2026-04-21T13:56:36Z","snapshot_observed_at":"2026-08-11T10:18:22.825892Z","submitted_at":"2026-04-21T13:56:36Z","title":"TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T02:45:10.577070Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2604.19473"},"observation_digest":"sha256:088b9f3604d56cc6e866f59874e81dcae31d4649a58eedb458707e3861cb7282","observation_id":"79254b7a-101c-4b9b-9afb-a7f5e1eca917","resolution":{"observed_at":"2026-05-10T02:53:29.943899Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-08-11T04:49:22.222888Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"cited_work":{"arxiv_id":"2412.00131","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.00131","snapshot_observed_at":"2026-07-08T14:44:59.776032Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","venue":"cs.CV","work_id":"51c0ab25-66f7-4d1a-a028-86b9b1b9e313","year":2024},"citing_paper":{"arxiv_id":"2604.19473","last_updated":"2026-04-21T13:56:36Z","snapshot_observed_at":"2026-08-11T10:18:22.825892Z","submitted_at":"2026-04-21T13:56:36Z","title":"TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T02:45:10.577070Z"},"links":{"cited_paper":"/paper/2412.00131","citing_paper":"/paper/2604.19473"},"observation_digest":"sha256:cb693631469a278be6afb8b50fdb8d8a955bfa11e1037bdcb85ac465f62b4674","observation_id":"117af888-d99e-4b7e-97e1-8f0468250913","resolution":{"observed_at":"2026-05-10T02:53:29.936813Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15091","last_updated":"2024-07-12T18:03:29Z","snapshot_observed_at":"2026-08-08T15:18:23.500459Z","submitted_at":"2023-09-26T17:36:26Z","title":"VideoDirectorGPT: Consistent Multi-scene Video Generation via LLM-Guided Planning","version":2},"cited_work":{"arxiv_id":"2309.15091","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.15091","snapshot_observed_at":"2026-07-04T14:59:55.973287Z","title":"Videodirectorgpt: Consistent multi-scene video generation via llm-guided planning","venue":null,"work_id":"386fe0af-d0c9-4b38-a690-55b83415dbe2","year":2023},"citing_paper":{"arxiv_id":"2604.19473","last_updated":"2026-04-21T13:56:36Z","snapshot_observed_at":"2026-08-11T10:18:22.825892Z","submitted_at":"2026-04-21T13:56:36Z","title":"TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T02:45:10.577070Z"},"links":{"cited_paper":"/paper/2309.15091","citing_paper":"/paper/2604.19473"},"observation_digest":"sha256:8237cfb325c9881116d7601709c75715b7d50b2df01c2b7a57f1c30e14eb841a","observation_id":"0c383d40-0285-442d-817d-50c420810adc","resolution":{"observed_at":"2026-05-10T02:53:29.929385Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-02T13:01:06.918463Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":"2401.03048","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-07-10T01:46:41.160163Z","title":"Latte: Latent Diffusion Transformer for Video Generation","venue":"cs.CV","work_id":"5328e907-7278-4781-a2bb-c5ef40dc87fb","year":2024},"citing_paper":{"arxiv_id":"2604.19473","last_updated":"2026-04-21T13:56:36Z","snapshot_observed_at":"2026-08-11T10:18:22.825892Z","submitted_at":"2026-04-21T13:56:36Z","title":"TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T02:45:10.577070Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2604.19473"},"observation_digest":"sha256:45a1f99dc0aaea9a77960691e708b53cc95b0aa64265d4bae2aa375176e7eb30","observation_id":"118c969b-57b7-4cf7-9781-c1842ef96b7f","resolution":{"observed_at":"2026-05-13T21:45:35.835056Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"U-net: Convolutional networks for biomed- ical image segmentation","venue":null,"work_id":"e855c2bd-a499-4020-8ff1-4d776a2ee042","year":2015},"citing_paper":{"arxiv_id":"2604.19473","last_updated":"2026-04-21T13:56:36Z","snapshot_observed_at":"2026-08-11T10:18:22.825892Z","submitted_at":"2026-04-21T13:56:36Z","title":"TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T02:45:10.577070Z"},"links":{"citing_paper":"/paper/2604.19473"},"observation_digest":"sha256:3582a9116d270e3e0a9651c668631fc24bd2ddbacc0b1d65f4a9b90792d01e8e","observation_id":"f0753719-1b15-42aa-bd84-05af895bd6ca","resolution":{"observed_at":"2026-05-22T19:37:01.538759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Longcat-video technical report","venue":null,"work_id":"c6190acc-2be0-4588-8aec-89df6ef22aef","year":2026},"citing_paper":{"arxiv_id":"2604.19473","last_updated":"2026-04-21T13:56:36Z","snapshot_observed_at":"2026-08-11T10:18:22.825892Z","submitted_at":"2026-04-21T13:56:36Z","title":"TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T02:45:10.577070Z"},"links":{"citing_paper":"/paper/2604.19473"},"observation_digest":"sha256:0828707bc0c250b1db9c8c3cd37d9df8b914feb43cfc3bd48633f31a076235b1","observation_id":"8816a3ba-8772-4f67-a00a-840ad7beff4d","resolution":{"observed_at":"2026-05-22T19:37:01.544546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.22200","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:41.030379Z","title":"Longcat-video technical report.arXiv preprint arXiv:2510.22200","venue":null,"work_id":"b1a745e0-8d8e-4399-8d09-047d761f349d","year":2025},"citing_paper":{"arxiv_id":"2604.19473","last_updated":"2026-04-21T13:56:36Z","snapshot_observed_at":"2026-08-11T10:18:22.825892Z","submitted_at":"2026-04-21T13:56:36Z","title":"TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T02:45:10.577070Z"},"links":{"citing_paper":"/paper/2604.19473"},"observation_digest":"sha256:809aba9acc583aea26f90953ab48ef5cf92b890dfae20da3c893ed5df5d6543d","observation_id":"be861c36-4715-4d8a-ac58-27b095d2df79","resolution":{"observed_at":"2026-05-10T02:53:29.946447Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2604.19473","last_updated":"2026-04-21T13:56:36Z","snapshot_observed_at":"2026-08-11T10:18:22.825892Z","submitted_at":"2026-04-21T13:56:36Z","title":"TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T02:45:10.577070Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2604.19473"},"observation_digest":"sha256:7c896dcf7cc03d78ddae10c49cef4ec2b7152fcd4cdcb915b1c8b2fc3c5ad491","observation_id":"0ac2aefb-0eba-43fc-bc0f-32c5a17f98c8","resolution":{"observed_at":"2026-05-10T02:53:29.941501Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2411.16657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dreamrunner: Fine-grained storytelling video gen- eration with retrieval-augmented motion adaptation","venue":null,"work_id":"2008dbf9-d5e6-4537-acf4-c18d5a17e59b","year":2024},"citing_paper":{"arxiv_id":"2604.19473","last_updated":"2026-04-21T13:56:36Z","snapshot_observed_at":"2026-08-11T10:18:22.825892Z","submitted_at":"2026-04-21T13:56:36Z","title":"TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T02:45:10.577070Z"},"links":{"citing_paper":"/paper/2604.19473"},"observation_digest":"sha256:31b77c70c20dfb534f1c6379e8a5a635cfb68088f27d5ecccfe4cb073c1beff3","observation_id":"e1ad8102-c819-4722-b346-2bd5ea659a37","resolution":{"observed_at":"2026-05-10T02:53:29.939209Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18003","last_updated":"2024-05-28T09:46:09Z","snapshot_observed_at":"2026-07-06T18:21:09.808086Z","submitted_at":"2024-05-28T09:46:09Z","title":"MAVIN: Multi-Action Video Generation with Diffusion Models via Transition Video Infilling","version":1},"cited_work":{"arxiv_id":"2405.18003","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.18003","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mavin: Multi- action video generation with diffusion models via transition video infilling.arXiv preprint arXiv:2405.18003","venue":null,"work_id":"e3fdbb11-0bd1-4887-93c3-b30a2d4b0c8b","year":null},"citing_paper":{"arxiv_id":"2604.19473","last_updated":"2026-04-21T13:56:36Z","snapshot_observed_at":"2026-08-11T10:18:22.825892Z","submitted_at":"2026-04-21T13:56:36Z","title":"TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T02:45:10.577070Z"},"links":{"cited_paper":"/paper/2405.18003","citing_paper":"/paper/2604.19473"},"observation_digest":"sha256:fc1a4d84475205a350cb6e10186c1f2e20ba4921dd2d91552b3b11dd74100911","observation_id":"a7ec3c7b-1855-4682-b364-2575f024a8d2","resolution":{"observed_at":"2026-05-10T02:53:29.934274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.14428","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:12:46.589792Z","title":"Magiccomp: Training-free dual-phase refinement for compositional video generation","venue":null,"work_id":"fe582a5a-8c85-4c97-b0e9-d0407e745bc5","year":2025},"citing_paper":{"arxiv_id":"2604.19473","last_updated":"2026-04-21T13:56:36Z","snapshot_observed_at":"2026-08-11T10:18:22.825892Z","submitted_at":"2026-04-21T13:56:36Z","title":"TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T02:45:10.577070Z"},"links":{"citing_paper":"/paper/2604.19473"},"observation_digest":"sha256:b252a6a72af05941d518fa43ee872362a525810fd784a65f11adb8547161a9f8","observation_id":"a177a1d8-693b-419d-ab36-0002b88977d9","resolution":{"observed_at":"2026-05-10T02:53:29.948877Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"cited_work":{"arxiv_id":"2412.20404","doi":"10.48550/arxiv.2412.20404","metadata_source":"pith","pith_arxiv_id":"2412.20404","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open-Sora: Democratizing Efficient Video Production for All","venue":"cs.CV","work_id":"8b29ba7b-3d84-4281-85b7-9eaf905afd7f","year":2024},"citing_paper":{"arxiv_id":"2604.19473","last_updated":"2026-04-21T13:56:36Z","snapshot_observed_at":"2026-08-11T10:18:22.825892Z","submitted_at":"2026-04-21T13:56:36Z","title":"TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T02:45:10.577070Z"},"links":{"cited_paper":"/paper/2412.20404","citing_paper":"/paper/2604.19473"},"observation_digest":"sha256:7ff8b6d49dc179fb599d3f445a4201955c0f16a9306706cb38e923c8911bdfb6","observation_id":"e7c25fe8-c48f-4fc5-9108-b62c57f85319","resolution":{"observed_at":"2026-05-11T12:01:52.219350Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Therefore, this section provides a supplementary explanation for scenarios involving multiple subjects","venue":null,"work_id":"15f40c00-59ec-4123-b99a-c7b69ebaff0a","year":2026},"citing_paper":{"arxiv_id":"2604.19473","last_updated":"2026-04-21T13:56:36Z","snapshot_observed_at":"2026-08-11T10:18:22.825892Z","submitted_at":"2026-04-21T13:56:36Z","title":"TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T02:45:10.577070Z"},"links":{"citing_paper":"/paper/2604.19473"},"observation_digest":"sha256:d448e926912b6bd8c87c0b77319dfa01d35af85e33c736d955f195c87601a0fa","observation_id":"bd3be9df-652d-4734-b421-f5b95a01abc9","resolution":{"observed_at":"2026-05-22T19:37:01.534664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Relying solely on attention reinforcement reduces TS-Attn to a mere attention enhancement mechanism for event tokens, lacking temporal correspondence","venue":null,"work_id":"f81b4282-306a-4a85-9d36-4495b7c23abd","year":2026},"citing_paper":{"arxiv_id":"2604.19473","last_updated":"2026-04-21T13:56:36Z","snapshot_observed_at":"2026-08-11T10:18:22.825892Z","submitted_at":"2026-04-21T13:56:36Z","title":"TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T02:45:10.577070Z"},"links":{"citing_paper":"/paper/2604.19473"},"observation_digest":"sha256:8b00bbc2bef1bfdb7d42eee5a052fc77436b658276f1890ee3b09400558f57cf","observation_id":"b2d55bc2-49f2-49c4-857a-5ba6ff2cbc8e","resolution":{"observed_at":"2026-05-22T19:37:01.528712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"As shown in Figure 9, the attention distributions of different actions in TS-Attn are clearly separated along the temporal sequence","venue":null,"work_id":"4d3e2937-971d-4d37-8280-8c8e2e01f00f","year":2026},"citing_paper":{"arxiv_id":"2604.19473","last_updated":"2026-04-21T13:56:36Z","snapshot_observed_at":"2026-08-11T10:18:22.825892Z","submitted_at":"2026-04-21T13:56:36Z","title":"TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T02:45:10.577070Z"},"links":{"citing_paper":"/paper/2604.19473"},"observation_digest":"sha256:81d532468ae9721ada2d85bf7a6279dcfebab5cc933a395bedf1b317fc70443e","observation_id":"ea8da723-6fe1-4088-a6db-519756208752","resolution":{"observed_at":"2026-05-22T19:37:01.530673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c1f851e0-3192-41ba-be3e-2aa820a1a721","year":2026},"citing_paper":{"arxiv_id":"2604.19473","last_updated":"2026-04-21T13:56:36Z","snapshot_observed_at":"2026-08-11T10:18:22.825892Z","submitted_at":"2026-04-21T13:56:36Z","title":"TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T02:45:10.577070Z"},"links":{"citing_paper":"/paper/2604.19473"},"observation_digest":"sha256:cec70325b71ffca26ae5d59220c355f703b8c17b31e2fa7cb58c9e864a235546","observation_id":"6a32f843-e629-4881-8b50-f69b4f2038f2","resolution":{"observed_at":"2026-05-22T19:37:01.532735Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"(2025), which natively supports video continuity","venue":null,"work_id":"f71668d4-78e0-49a8-8567-27731eb18f2a","year":2025},"citing_paper":{"arxiv_id":"2604.19473","last_updated":"2026-04-21T13:56:36Z","snapshot_observed_at":"2026-08-11T10:18:22.825892Z","submitted_at":"2026-04-21T13:56:36Z","title":"TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T02:45:10.577070Z"},"links":{"citing_paper":"/paper/2604.19473"},"observation_digest":"sha256:0dce428e7c90e54471e352533d902e4b46784925123cb93f3ce8eab1b8dd35e8","observation_id":"af187422-e27d-44cc-a545-b67b002f14ab","resolution":{"observed_at":"2026-05-22T19:37:01.536588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"These results highlight the potential of TS-Attn for both interactive and long-form video generation","venue":null,"work_id":"e7c37bbf-a53d-4263-a3c8-1bdf043ab461","year":2026},"citing_paper":{"arxiv_id":"2604.19473","last_updated":"2026-04-21T13:56:36Z","snapshot_observed_at":"2026-08-11T10:18:22.825892Z","submitted_at":"2026-04-21T13:56:36Z","title":"TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T02:45:10.577070Z"},"links":{"citing_paper":"/paper/2604.19473"},"observation_digest":"sha256:1520ddcb130408e8e7d764c97ed0b50b77bd3a575a200908d4025a3dfd5bb432","observation_id":"e0d31b98-f067-4839-940e-38e4f967d706","resolution":{"observed_at":"2026-05-22T19:37:01.526466Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.19473","last_updated":"2026-04-21T13:56:36Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T10:18:22.825892Z","submitted_at":"2026-04-21T13:56:36Z","title":"TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":1,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":1,"verified_exact":15,"verified_fuzzy":8},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 1 inbound Pith citation observation for arXiv:2604.19473."}