{"as_of":"2026-08-10T14:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6915678cbf8696abcaeeb4b0ac6e0bb8d5491d9ece6064cea2a49b593cd80627","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":32,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:59:29.507056Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T21:10:09.697793Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-07T16:12:03.138083Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2504.02436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-07-04T21:10:09.697793Z","title":"Skyreels-a2: Compose anything in video diffusion transformers","venue":null,"work_id":"68c0143f-c4c7-49b9-8128-0d821f39406e","year":2025},"citing_paper":{"arxiv_id":"2504.13074","last_updated":"2025-04-21T10:34:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-17T16:37:27Z","title":"SkyReels-V2: Infinite-length Film Generative Model","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-14T20:23:04.022599Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2504.13074"},"observation_digest":"sha256:dd682cbe5ce4d420385532bd774eccefae9a4213da29bb25ebfc8d330e0436d1","observation_id":"39046ad6-2539-40e1-b5a4-c817f2aee04a","resolution":{"observed_at":"2026-05-14T20:23:04.222693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-07T16:12:03.138083Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-08-07T13:59:29.507056Z","title":"Skyreels-a2: Compose anything in video diffusion trans- formers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:29.507056Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:34b57f2733ec9047953884324a7eb0ef119a56a4a62a53d3748cb29f7ace2956","observation_id":"87b78b0f-fefc-47bf-a394-e5f5bcd6680b","resolution":{"observed_at":"2026-08-07T13:59:29.507056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-07T16:12:03.138083Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-08-07T12:01:05.579680Z","title":"Skyreels-a2: Compose anything in video diffusion transform- ers.arXiv preprint arXiv:2504.02436, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:05.579680Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:c44f7303c6f7217a20441b321a18fc916247f6537164fc9a13ad0e323c792665","observation_id":"ab65c0ea-f8a6-4c34-b126-694ca2bb456c","resolution":{"observed_at":"2026-08-07T12:01:05.579680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-07T16:12:03.138083Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-08-07T05:30:32.911278Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:32.911278Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:7971fda39e8d26224385a0c82d2f5f34c2dd645ef809ee6584f5680e18c729b5","observation_id":"d13d751c-5cc6-4351-86f9-1e9a92164b10","resolution":{"observed_at":"2026-08-07T05:30:32.911278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-07T16:12:03.138083Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-08-06T23:20:08.358935Z","title":"Skyreels-a2: Compose anything in video diffusion transformers.arXiv preprint arXiv:2504.02436, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-08T15:15:43.495121Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:08.358935Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:e7ceb9f0ba37e88fe9b0ce331862a5bbdca3dfe3d12551df4a03fe1d4242a5a0","observation_id":"3578d72a-dae4-4e0f-9541-0faced2c218e","resolution":{"observed_at":"2026-08-06T23:20:08.358935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-07T16:12:03.138083Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-08-03T15:28:49.621536Z","title":"Skyreels-a2: Compose anything in video diffusion transformers.arXiv preprint arXiv:2504.02436,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.17796","last_updated":"2026-06-24T08:52:20Z","snapshot_observed_at":"2026-08-06T07:44:38.380189Z","submitted_at":"2025-12-18T18:59:18Z","title":"CustomX: Unified Character, Action, and Scene Customization in Video World Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T15:28:49.621536Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2512.17796"},"observation_digest":"sha256:fe60cbb33f9b80614619816b3ea6fc5e2d174c2931392eb552234baf1e496632","observation_id":"d6acd82e-d179-47d7-9f00-b4b7cc9edfba","resolution":{"observed_at":"2026-08-03T15:28:49.621536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-07T16:12:03.138083Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-08-03T00:11:11.237810Z","title":"Skyreels-a2: Compose anything in video dif- fusion transformers.arXiv preprint arXiv:2504.02436, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12304","last_updated":"2026-07-23T11:24:08Z","snapshot_observed_at":"2026-08-03T00:11:08.466564Z","submitted_at":"2026-02-12T03:25:41Z","title":"OmniCustom: Sync Audio-Video Customization Via Joint Audio-Video Generation Model","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T00:11:11.237810Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2602.12304"},"observation_digest":"sha256:009024e9e4792783b4ad977f4717b09cd9840045ca91cc8d8e390c32365d5479","observation_id":"1b6d3fdb-d546-415e-8772-7bc04b4a3446","resolution":{"observed_at":"2026-08-03T00:11:11.237810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-07T16:12:03.138083Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-07-13T18:01:19.034578Z","title":"Skyreels-a2: Compose anything in video diffusion transform- ers.arXiv preprint arXiv:2504.02436, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.25743","last_updated":"2026-06-29T08:23:47Z","snapshot_observed_at":"2026-08-08T15:15:46.111735Z","submitted_at":"2026-03-26T17:59:57Z","title":"RefAlign: Representation Alignment for Reference-to-Video Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T18:01:19.034578Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2603.25743"},"observation_digest":"sha256:1894cfac5d55ae972a4c671386f4ebc8948a034245acf3f0912a0f854cf5fc86","observation_id":"b1f8a611-a649-4508-8766-71186b1dff45","resolution":{"observed_at":"2026-07-13T18:01:19.034578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-07T16:12:03.138083Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-07-13T12:23:05.876881Z","title":"Skyreels-a2: Compose anything in video dif- fusion transformers.arXiv preprint arXiv:2504.02436, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03738","last_updated":"2026-04-04T13:50:38Z","snapshot_observed_at":"2026-08-06T04:04:52.686841Z","submitted_at":"2026-04-04T13:50:38Z","title":"Rethinking Position Embedding as a Context Controller for Multi-Reference and Multi-Shot Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T12:23:05.876881Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2604.03738"},"observation_digest":"sha256:3dc3fdb2698bed78046db32b1484a78bb204fa9a557bda5b6f4758a94b5d755b","observation_id":"2fc26fd8-3a6e-41f9-848c-bfa68a93da58","resolution":{"observed_at":"2026-07-13T12:23:05.876881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-07T16:12:03.138083Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2504.02436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-07-04T21:10:09.697793Z","title":"Skyreels-a2: Compose anything in video diffusion transformers","venue":null,"work_id":"68c0143f-c4c7-49b9-8128-0d821f39406e","year":2025},"citing_paper":{"arxiv_id":"2604.06339","last_updated":"2026-04-07T18:17:05Z","snapshot_observed_at":"2026-07-06T22:54:53.308309Z","submitted_at":"2026-04-07T18:17:05Z","title":"Evolution of Video Generative Foundations","version":1},"reference_index":203,"source":"pdf_text","source_observed_at":"2026-05-10T18:41:38.616611Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2604.06339"},"observation_digest":"sha256:69f4e5808e124abafe460b1e92b5f839ea9de63e1e919db55ef20fd423d6c77a","observation_id":"72e0e95b-1a83-4e3c-9ff6-e486b320c67c","resolution":{"observed_at":"2026-05-11T00:05:51.736553Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-07T16:12:03.138083Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2504.02436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-07-04T21:10:09.697793Z","title":"Skyreels-a2: Compose anything in video diffusion transformers","venue":null,"work_id":"68c0143f-c4c7-49b9-8128-0d821f39406e","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-08-06T16:53:42.723002Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:0f7a6f64e776508a2dc36ee2bc3dafa5dd7698fa54e6970f4499e44d103b5a8e","observation_id":"6d430c7f-fd44-475e-80bd-e20e4a92d472","resolution":{"observed_at":"2026-05-11T11:11:00.589537Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-07T16:12:03.138083Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2504.02436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-07-04T21:10:09.697793Z","title":"Skyreels-a2: Compose anything in video diffusion transformers","venue":null,"work_id":"68c0143f-c4c7-49b9-8128-0d821f39406e","year":2025},"citing_paper":{"arxiv_id":"2604.19679","last_updated":"2026-06-29T16:38:23Z","snapshot_observed_at":"2026-07-06T23:06:16.972438Z","submitted_at":"2026-04-21T16:57:23Z","title":"MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T02:55:09.008954Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2604.19679"},"observation_digest":"sha256:0aac87f02bbc3bd2ef2dd7ef90bd4c2fc2686d0993d172ff0432d346e2a4e78f","observation_id":"abfaf6de-042a-4f2f-a06f-c4a18735ba4f","resolution":{"observed_at":"2026-05-11T12:46:27.920254Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-07T16:12:03.138083Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2504.02436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-07-04T21:10:09.697793Z","title":"Skyreels-a2: Compose anything in video diffusion transformers","venue":null,"work_id":"68c0143f-c4c7-49b9-8128-0d821f39406e","year":2025},"citing_paper":{"arxiv_id":"2604.27918","last_updated":"2026-04-30T14:22:27Z","snapshot_observed_at":"2026-07-06T23:13:20.516759Z","submitted_at":"2026-04-30T14:22:27Z","title":"Generate Your Talking Avatar from Video Reference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-07T05:32:04.519820Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2604.27918"},"observation_digest":"sha256:17e06520c1db397f449fe6e1721973d74847b5e7247819e5556962ed8b4aae9f","observation_id":"f809b158-7281-40e1-a246-02951b9a356a","resolution":{"observed_at":"2026-05-12T10:36:29.822714Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-07T16:12:03.138083Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2504.02436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-07-04T21:10:09.697793Z","title":"Skyreels-a2: Compose anything in video diffusion transformers","venue":null,"work_id":"68c0143f-c4c7-49b9-8128-0d821f39406e","year":2025},"citing_paper":{"arxiv_id":"2605.02948","last_updated":"2026-05-11T03:04:55Z","snapshot_observed_at":"2026-08-08T22:18:14.048236Z","submitted_at":"2026-05-01T16:38:06Z","title":"AsymTalker: Identity-Consistent Long-Term Talking Head Generation via Asymmetric Distillation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-09T20:19:39.565157Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2605.02948"},"observation_digest":"sha256:3802fec879c42ee48d8bd6b19d623415fd1590512f83f9ee620c8c800a3ec7e3","observation_id":"c9566795-c710-47f4-a259-cb5f6d37f777","resolution":{"observed_at":"2026-05-11T15:16:11.513027Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-07T16:12:03.138083Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2504.02436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-07-04T21:10:09.697793Z","title":"Skyreels-a2: Compose anything in video diffusion transformers","venue":null,"work_id":"68c0143f-c4c7-49b9-8128-0d821f39406e","year":2025},"citing_paper":{"arxiv_id":"2605.02948","last_updated":"2026-05-11T03:04:55Z","snapshot_observed_at":"2026-08-08T22:18:14.048236Z","submitted_at":"2026-05-01T16:38:06Z","title":"AsymTalker: Identity-Consistent Long-Term Talking Head Generation via Asymmetric Distillation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-11T02:18:58.996355Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2605.02948"},"observation_digest":"sha256:489902ac1a5d0f18e8189ff7a4a33ae8520cc1cc00c40f9b7c2de487d1677600","observation_id":"214c9d33-2862-44ea-a967-9c7f20332a3b","resolution":{"observed_at":"2026-05-11T03:45:57.606468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-07T16:12:03.138083Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2504.02436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-07-04T21:10:09.697793Z","title":"Skyreels-a2: Compose anything in video diffusion transformers","venue":null,"work_id":"68c0143f-c4c7-49b9-8128-0d821f39406e","year":2025},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:31c9212af06e711e23c3a75f066baff429e343991f3a4f55a193b925286346e8","observation_id":"9aa3b2cc-8c15-4372-9f55-8689061fc327","resolution":{"observed_at":"2026-05-11T17:21:09.728834Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-07T16:12:03.138083Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2504.02436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-07-04T21:10:09.697793Z","title":"Skyreels-a2: Compose anything in video diffusion transformers","venue":null,"work_id":"68c0143f-c4c7-49b9-8128-0d821f39406e","year":2025},"citing_paper":{"arxiv_id":"2605.15824","last_updated":"2026-06-17T15:16:37Z","snapshot_observed_at":"2026-08-03T19:41:20.540916Z","submitted_at":"2026-05-15T10:25:06Z","title":"FashionChameleon: Towards Real-Time and Interactive Human-Garment Video Customization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T20:11:33.277349Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2605.15824"},"observation_digest":"sha256:55aead9025c778f0599b2c74e0ce385b19d4757fa3d0ff806b31a1dc59216eb1","observation_id":"34ff1e3e-f549-4184-b7b4-3404c3260b75","resolution":{"observed_at":"2026-05-20T20:13:43.556258Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-07T16:12:03.138083Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2504.02436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-07-04T21:10:09.697793Z","title":"Skyreels-a2: Compose anything in video diffusion transformers","venue":null,"work_id":"68c0143f-c4c7-49b9-8128-0d821f39406e","year":2025},"citing_paper":{"arxiv_id":"2605.15824","last_updated":"2026-06-17T15:16:37Z","snapshot_observed_at":"2026-08-03T19:41:20.540916Z","submitted_at":"2026-05-15T10:25:06Z","title":"FashionChameleon: Towards Real-Time and Interactive Human-Garment Video Customization","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T19:23:07.044659Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2605.15824"},"observation_digest":"sha256:133034ebf2c78f2cc9fed1d737421b0ec22506b2395d2e82e626a6de51112a8c","observation_id":"8923338d-5b4a-4ab9-a032-b86c1e9aa642","resolution":{"observed_at":"2026-06-30T19:25:00.575779Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-07T16:12:03.138083Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2504.02436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-07-04T21:10:09.697793Z","title":"Skyreels-a2: Compose anything in video diffusion transformers","venue":null,"work_id":"68c0143f-c4c7-49b9-8128-0d821f39406e","year":2025},"citing_paper":{"arxiv_id":"2605.17488","last_updated":"2026-05-17T14:56:52Z","snapshot_observed_at":"2026-08-04T04:39:45.061732Z","submitted_at":"2026-05-17T14:56:52Z","title":"Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T14:08:30.802619Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2605.17488"},"observation_digest":"sha256:8976a100d20a84500bd33ae57a8be970c74ad379df3857404324199c37ab9eba","observation_id":"2d1a34fd-fe81-4098-a5e2-3b1286bbf6a7","resolution":{"observed_at":"2026-05-20T14:13:21.376116Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-07T16:12:03.138083Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2504.02436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-07-04T21:10:09.697793Z","title":"Skyreels-a2: Compose anything in video diffusion transformers","venue":null,"work_id":"68c0143f-c4c7-49b9-8128-0d821f39406e","year":2025},"citing_paper":{"arxiv_id":"2605.22051","last_updated":"2026-05-21T06:38:22Z","snapshot_observed_at":"2026-07-06T23:32:25.286443Z","submitted_at":"2026-05-21T06:38:22Z","title":"EasyVFX: Frequency-Driven Decoupling for Resource-Efficient VFX Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T06:30:18.961069Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2605.22051"},"observation_digest":"sha256:52e2089b693126dc81005775e6c08f23a9748a601fc476979bb6c4324cb90858","observation_id":"49ff3ff5-4d70-4335-814f-50e9c371f5c2","resolution":{"observed_at":"2026-05-22T06:31:09.909379Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-07T16:12:03.138083Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2504.02436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-07-04T21:10:09.697793Z","title":"Skyreels-a2: Compose anything in video diffusion transformers","venue":null,"work_id":"68c0143f-c4c7-49b9-8128-0d821f39406e","year":2025},"citing_paper":{"arxiv_id":"2605.22344","last_updated":"2026-05-21T11:30:29Z","snapshot_observed_at":"2026-07-06T23:32:39.761431Z","submitted_at":"2026-05-21T11:30:29Z","title":"Bernini: Latent Semantic Planning for Video Diffusion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T06:39:47.124605Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2605.22344"},"observation_digest":"sha256:db8c5801e4240fc7b17ed30c9fde0929303e37047abd9eba15ca0cbdf75cae01","observation_id":"641621f0-0387-4d94-b33e-9082869dd837","resolution":{"observed_at":"2026-05-22T06:41:10.408596Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-07T16:12:03.138083Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2504.02436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-07-04T21:10:09.697793Z","title":"Skyreels-a2: Compose anything in video diffusion transformers","venue":null,"work_id":"68c0143f-c4c7-49b9-8128-0d821f39406e","year":2025},"citing_paper":{"arxiv_id":"2606.02441","last_updated":"2026-06-01T16:12:18Z","snapshot_observed_at":"2026-08-08T05:56:53.706139Z","submitted_at":"2026-06-01T16:12:18Z","title":"Spatial-Temporal Decoupled Reference Conditioning for Identity-Preserving Text-to-Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T15:25:22.778550Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2606.02441"},"observation_digest":"sha256:dc436cbbb112a3d49de909f03207594e3f24f9e6ae25777da0283bc4dbe6118f","observation_id":"4243e34e-c835-4773-91d9-83118c6f6ee1","resolution":{"observed_at":"2026-07-01T22:26:17.490012Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-07T16:12:03.138083Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2504.02436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-07-04T21:10:09.697793Z","title":"Skyreels-a2: Compose anything in video diffusion transformers","venue":null,"work_id":"68c0143f-c4c7-49b9-8128-0d821f39406e","year":2025},"citing_paper":{"arxiv_id":"2606.07508","last_updated":"2026-06-05T17:57:32Z","snapshot_observed_at":"2026-08-03T10:42:24.485829Z","submitted_at":"2026-06-05T17:57:32Z","title":"Streaming Video Generation with Streaming Force Control","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T22:14:32.465663Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2606.07508"},"observation_digest":"sha256:590707a28175080881bbc207ef68578246d216d1fcf9869611031ebf5c701ed7","observation_id":"5283a361-62e2-45a8-b4eb-f8d9ed9e2e13","resolution":{"observed_at":"2026-07-02T17:07:12.380960Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-07T16:12:03.138083Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2504.02436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-07-04T21:10:09.697793Z","title":"Skyreels-a2: Compose anything in video diffusion transformers","venue":null,"work_id":"68c0143f-c4c7-49b9-8128-0d821f39406e","year":2025},"citing_paper":{"arxiv_id":"2606.11670","last_updated":"2026-06-10T05:29:09Z","snapshot_observed_at":"2026-08-09T12:29:17.060154Z","submitted_at":"2026-06-10T05:29:09Z","title":"ARGUS: Stacked Multi-View Identity Mosaic Injection for Subject-Preserving Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T10:46:56.871174Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2606.11670"},"observation_digest":"sha256:aea5fe284b60ee154bdf623ba6b6fb703834a136749a581bba6d9fb609aac6ad","observation_id":"0afa77da-e7c3-4a5a-a63a-19e530758b4b","resolution":{"observed_at":"2026-07-03T08:17:45.951440Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-07T16:12:03.138083Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2504.02436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-07-04T21:10:09.697793Z","title":"Skyreels-a2: Compose anything in video diffusion transformers","venue":null,"work_id":"68c0143f-c4c7-49b9-8128-0d821f39406e","year":2025},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:7d302bf06fcd4553d8d8ec71c9057f70dcafc5f2acdefbdc13550b846163c40c","observation_id":"929fbd2a-cce8-4503-a2d1-03045acf5f06","resolution":{"observed_at":"2026-07-03T14:58:32.689770Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-07T16:12:03.138083Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2504.02436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-07-04T21:10:09.697793Z","title":"Skyreels-a2: Compose anything in video diffusion transformers","venue":null,"work_id":"68c0143f-c4c7-49b9-8128-0d821f39406e","year":2025},"citing_paper":{"arxiv_id":"2606.24107","last_updated":"2026-07-03T09:17:12Z","snapshot_observed_at":"2026-08-01T13:42:02.404759Z","submitted_at":"2026-06-23T03:50:28Z","title":"DramaDirector: Geometry-Guided Short Drama Generation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-26T01:57:15.550335Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2606.24107"},"observation_digest":"sha256:5f64d6e35cc8b4d7ad04fe4b82bce46fbd6fff140a21ed43b867d96ae9991ace","observation_id":"08d03e3d-dd47-4ca5-88ce-e75f00e6a344","resolution":{"observed_at":"2026-07-04T14:59:55.923797Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-07T16:12:03.138083Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2504.02436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-07-04T21:10:09.697793Z","title":"Skyreels-a2: Compose anything in video diffusion transformers","venue":null,"work_id":"68c0143f-c4c7-49b9-8128-0d821f39406e","year":2025},"citing_paper":{"arxiv_id":"2606.26058","last_updated":"2026-06-24T17:33:13Z","snapshot_observed_at":"2026-08-07T10:26:25.230801Z","submitted_at":"2026-06-24T17:33:13Z","title":"DomainShuttle: Freeform Open Domain Subject-driven Text-to-video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-25T19:00:23.260939Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2606.26058"},"observation_digest":"sha256:f3fd1b6cb81c4dfd5f07c785c8ced9acc47b2d751099e11a7c1990a7a9116e3d","observation_id":"b53a9ff1-507c-4eca-b576-3096239f3fab","resolution":{"observed_at":"2026-07-04T21:10:09.699283Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-07T16:12:03.138083Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-07-11T20:11:31.576642Z","title":"arXiv preprint arXiv:2504.02436 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04311","last_updated":"2026-07-07T14:30:21Z","snapshot_observed_at":"2026-08-04T12:36:41.280283Z","submitted_at":"2026-07-05T13:54:33Z","title":"Aura: Consistent Multi-Subject Video Generation via VLM-Grounded Semantic Alignment","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-11T20:11:31.576642Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2607.04311"},"observation_digest":"sha256:c831c9f4981dedbb6e0e21d579457bebd3c6344f9861bb5c1a2b35b5027dc5cd","observation_id":"e285619c-f356-468f-af29-8b43e4a227d8","resolution":{"observed_at":"2026-07-11T20:11:31.576642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-07T16:12:03.138083Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-08-01T16:30:00.510556Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17985","last_updated":"2026-07-20T14:16:49Z","snapshot_observed_at":"2026-08-08T15:15:32.999700Z","submitted_at":"2026-07-20T14:16:49Z","title":"Keyframe-Anchored Identity Preservation for Sequential-Action Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T16:30:00.510556Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2607.17985"},"observation_digest":"sha256:e4159bd6d09b24fabc26695e5e8b5a49822dcc32518c112751114ae6045aceb6","observation_id":"78d4f218-73d2-4042-bb9a-9381a80e5282","resolution":{"observed_at":"2026-08-01T16:30:00.510556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-07T16:12:03.138083Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-08-01T15:42:19.331303Z","title":"Skyreels-a2: Compose anything in video diffusion transform- ers.arXiv preprint arXiv:2504.02436, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18217","last_updated":"2026-07-21T02:55:50Z","snapshot_observed_at":"2026-08-08T15:15:45.449643Z","submitted_at":"2026-07-20T17:51:35Z","title":"HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enhancement","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:19.331303Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2607.18217"},"observation_digest":"sha256:1711cd1e23a66ea8c7839a42e2ac8213331836332d39d24fe582181901a9261b","observation_id":"c532743d-3314-4c6a-bf32-0df7f6622b84","resolution":{"observed_at":"2026-08-01T15:42:19.331303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-07T16:12:03.138083Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-08-01T10:24:51.437202Z","title":"Skyreels-a2: Compose anything in video diffusion transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20247","last_updated":"2026-07-22T15:08:30Z","snapshot_observed_at":"2026-08-08T13:59:00.018749Z","submitted_at":"2026-07-22T15:08:30Z","title":"Vera: Identity-Faithful Human Subject-to-Video Generation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T10:24:51.437202Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2607.20247"},"observation_digest":"sha256:ad53f18963d6a32bca0a1478f18306720c5679c166e1b8877f2ff3492f6bbfcc","observation_id":"36060856-f20e-4f5f-8a43-15ad641130d3","resolution":{"observed_at":"2026-08-01T10:24:51.437202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-07T16:12:03.138083Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-08-01T13:56:37.838490Z","title":"arXiv preprint arXiv:2504.02436 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26529","last_updated":"2026-07-29T06:48:11Z","snapshot_observed_at":"2026-08-10T00:44:15.777206Z","submitted_at":"2026-07-29T06:48:11Z","title":"CineWeaver: Training-Free Reference-Controllable Multi-Shot Long Video Generation for Cinematic Storytelling","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-01T13:56:37.838490Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2607.26529"},"observation_digest":"sha256:5fd1e6af58608fccaef012b061633a79991ec8feef48a32f5113f30a14de7210","observation_id":"893e6074-5bbd-470d-bdf8-5352e25aa5b9","resolution":{"observed_at":"2026-08-01T13:56:37.838490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.02436/citation-record","integrity":"/paper/2504.02436/integrity","json":"/paper/2504.02436/citation-record.json","paper":"/paper/2504.02436"},"outbound":[],"paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T16:12:03.138083Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 32 inbound Pith citation observations for arXiv:2504.02436."}