{"as_of":"2026-08-06T14:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ec2c774306dd568425fcc5e171b79daee7e8386a9a837b1817a1bcc06d6d762d","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T16:24:59.444766Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":32,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T00:05:47.808077Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T14:48:32.703864Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-08-05T00:05:47.808077Z","title":"Wan-s2v: Audio-driven cinematic video generation.arXiv preprint arXiv:2508.18621, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06155","last_updated":"2025-09-07T17:55:03Z","snapshot_observed_at":"2026-08-05T00:05:44.790684Z","submitted_at":"2025-09-07T17:55:03Z","title":"UniVerse-1: Unified Audio-Video Generation via Stitching of Experts","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T00:05:47.808077Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2509.06155"},"observation_digest":"sha256:124025ef0cfdc4735c1057fe1cae7da774e402d027bb6f6116acffafa1733a70","observation_id":"823551b6-d303-469f-a713-b7cff82979e0","resolution":{"observed_at":"2026-08-05T00:05:47.808077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2510.01186","last_updated":"2026-04-14T16:17:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-01T17:59:56Z","title":"ASTRA: Let Arbitrary Subjects Transform in Video Editing","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T10:13:10.141426Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2510.01186"},"observation_digest":"sha256:f51b42ba1c9447938a3b6ad3786ccdd10af5d23cc9c4b158acbf1fe77b682974","observation_id":"31fba0ea-5d3d-4267-8785-c127026cd2ba","resolution":{"observed_at":"2026-05-18T10:16:14.277804Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-08-03T20:39:16.078524Z","title":"Wan-S2V: Audio-driven cinematic video gener- ation.preprint arXiv:2508.18621, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19065","last_updated":"2026-05-25T08:00:25Z","snapshot_observed_at":"2026-08-06T05:46:38.423987Z","submitted_at":"2025-11-24T12:59:27Z","title":"Understanding, Accelerating, and Improving MeanFlow Training","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T20:39:16.078524Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2511.19065"},"observation_digest":"sha256:8a4056b9fc4cfe9db3280b1dadcd62c179cde8df32390c2b6cee7c5d1f649ae3","observation_id":"6e6f1077-bff7-42c6-91f1-b22c9c3940db","resolution":{"observed_at":"2026-08-03T20:39:16.078524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T23:09:55.836036Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-17T01:56:44.123092Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:4a0e447fed118625885f42dbec3da320b6a7e9a58079fb92b7a21adab0a3407b","observation_id":"d3775d6b-28f1-4e2d-8dd4-07c78e054cc5","resolution":{"observed_at":"2026-05-17T01:58:51.463818Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-08-03T18:39:41.295310Z","title":"Wan-s2v: Audio-driven cinematic video generation.arXiv preprint arXiv:2508.18621, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T23:09:55.836036Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:41.295310Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:7422210bd2ddcdd20bd6f76cfadf8905f862c0710aa86b7c6a25ad81968053ca","observation_id":"81c585a6-fcc6-41ec-8429-171803c4fc2b","resolution":{"observed_at":"2026-08-03T18:39:41.295310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-08-03T16:25:55.546710Z","title":"Wan-s2v: Audio-driven cinematic video generation.arXiv preprint arXiv:2508.18621, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T23:14:18.016086Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:55.546710Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:da0a9b976496d1c351310aae37180e80917f8ae49824b4f5b56b9e1c99f458ff","observation_id":"f1e3d810-2745-4a83-8ad8-805a95a82067","resolution":{"observed_at":"2026-08-03T16:25:55.546710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2601.03233","last_updated":"2026-01-06T18:24:41Z","snapshot_observed_at":"2026-07-06T22:40:51.136169Z","submitted_at":"2026-01-06T18:24:41Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T07:06:20.470686Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2601.03233"},"observation_digest":"sha256:8e89d6d1ba98d1ae099f67cffa2998806117b4e535f1836156428fb98f4ebf88","observation_id":"c39098de-37ea-4f0a-9dee-cc030938ab7f","resolution":{"observed_at":"2026-05-13T07:06:20.610336Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2602.09534","last_updated":"2026-05-10T13:50:44Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T08:45:51Z","title":"AUHead: Realistic Emotional Talking Head Generation via Action Units Control","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T05:49:15.734418Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2602.09534"},"observation_digest":"sha256:fbabd49d8f288d24ac6c365846c2f2ce7b5f019521dc76c8ef90d7bd3e8854d2","observation_id":"aeee2f62-f7d9-4b5a-93e4-43ba92da5b75","resolution":{"observed_at":"2026-05-16T05:50:40.238327Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2602.13669","last_updated":"2026-04-22T07:41:44Z","snapshot_observed_at":"2026-07-06T22:45:53.926021Z","submitted_at":"2026-02-14T08:32:38Z","title":"EchoTorrent: Towards Swift, Sustained, and Streaming Multi-Modal Video Generation","version":5},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-15T22:20:16.320171Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2602.13669"},"observation_digest":"sha256:c96a48fbf43ca09a32d451035f260d2e376fc58e61394409492090c6f449c609","observation_id":"b2b5bc18-be68-4dac-98bf-d3478a9c8bab","resolution":{"observed_at":"2026-05-15T22:20:22.182089Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2604.07823","last_updated":"2026-04-14T22:09:01Z","snapshot_observed_at":"2026-07-06T22:57:05.146373Z","submitted_at":"2026-04-09T05:26:09Z","title":"LPM 1.0: Video-based Character Performance Model","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T17:09:17.360697Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2604.07823"},"observation_digest":"sha256:0f941e70191b617b6070883c700a7f75f48fad8a3c57da964699689ccd1545f5","observation_id":"ed9b6ca1-feca-4e93-8d37-466dc6ccce21","resolution":{"observed_at":"2026-05-11T07:30:59.901752Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2604.09057","last_updated":"2026-04-16T03:03:01Z","snapshot_observed_at":"2026-07-06T22:58:04.106299Z","submitted_at":"2026-04-10T07:37:03Z","title":"Tora3: Trajectory-Guided Audio-Video Generation with Physical Coherence","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T17:13:06.005185Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2604.09057"},"observation_digest":"sha256:271b674b7ec904af4442fc3c596e0c96d45f500c36fdd7eb2e96aeac26d64471","observation_id":"53a221fe-6b10-4d3c-91ec-02fc5e31bc78","resolution":{"observed_at":"2026-05-11T07:20:58.586177Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2604.19636","last_updated":"2026-04-21T16:25:43Z","snapshot_observed_at":"2026-07-06T23:06:16.972438Z","submitted_at":"2026-04-21T16:25:43Z","title":"CoInteract: Physically-Consistent Human-Object Interaction Video Synthesis via Spatially-Structured Co-Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T03:14:45.834520Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2604.19636"},"observation_digest":"sha256:ce57e30412042d0e846d12b706429b39ec6e724114e1333e8c9f7f46cf31352c","observation_id":"915f1fcc-8e73-4951-b8ff-7eabc64a9178","resolution":{"observed_at":"2026-05-11T12:41:04.221942Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:1ab21f6c9584d0d1bb1ba9e815ed69261a15ca3a73d97fa801b712f9a94a4792","observation_id":"3ea3c7b8-d52c-47e6-9c48-0973c96485da","resolution":{"observed_at":"2026-05-11T23:31:14.635424Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2604.27918","last_updated":"2026-04-30T14:22:27Z","snapshot_observed_at":"2026-07-06T23:13:20.516759Z","submitted_at":"2026-04-30T14:22:27Z","title":"Generate Your Talking Avatar from Video Reference","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-07T05:32:04.519820Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2604.27918"},"observation_digest":"sha256:7f945622940e447ba8d8a20ae1c356eea25303eb164caa4372b1418b5f3b7eb6","observation_id":"0615e64f-6599-41bd-83d8-5bcb33534e7c","resolution":{"observed_at":"2026-05-12T10:36:29.776769Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2605.06192","last_updated":"2026-05-07T13:06:19Z","snapshot_observed_at":"2026-07-06T23:18:41.400741Z","submitted_at":"2026-05-07T13:06:19Z","title":"EA-WM: Event-Aware Generative World Model with Structured Kinematic-to-Visual Action Fields","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T13:50:37.638842Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2605.06192"},"observation_digest":"sha256:ef9f87c7b2d825ae3e6feaefc96f499ed2c26e6370b211f475606d12b0f02771","observation_id":"a3dc51c6-bb87-40c8-b871-35b2a91dfdc1","resolution":{"observed_at":"2026-05-11T18:51:06.456958Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2605.11424","last_updated":"2026-05-12T02:20:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T02:20:31Z","title":"VidSplat: Gaussian Splatting Reconstruction with Geometry-Guided Video Diffusion Priors","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:29.091220Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2605.11424"},"observation_digest":"sha256:8bc4a339dbfecb7547ec0ea6965e8f2c549b30d9c70325aed62f8e81ffba6b77","observation_id":"37293b50-a45c-4a27-a122-eaa91e372b17","resolution":{"observed_at":"2026-05-13T02:02:06.244777Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2605.17488","last_updated":"2026-05-17T14:56:52Z","snapshot_observed_at":"2026-08-04T04:39:45.061732Z","submitted_at":"2026-05-17T14:56:52Z","title":"Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T14:08:30.802619Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2605.17488"},"observation_digest":"sha256:a63babcaf1d1e6db968f46f28857b0c8ed1e639a9bf3289b2250aefad74b4257","observation_id":"85ee8bdd-7e3f-4f54-b055-863779596bf1","resolution":{"observed_at":"2026-05-20T14:13:21.362381Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:e0bef7ab7c49de1d2ac40e5e2281613dd8d219df8cd3701e543ca9595830a0e1","observation_id":"fe6b0a7c-2970-472b-a76c-05962dcf8ef6","resolution":{"observed_at":"2026-06-29T22:24:00.909558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2605.26486","last_updated":"2026-05-26T02:54:12Z","snapshot_observed_at":"2026-08-03T07:56:02.917440Z","submitted_at":"2026-05-26T02:54:12Z","title":"LongCat-Video-Avatar 1.5 Technical Report","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T18:28:16.968339Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2605.26486"},"observation_digest":"sha256:a018b6a586232710147fa9caf089f024be226d7084ed6f57c20b6c1b1bc239ee","observation_id":"39e56e96-9933-4318-b211-5bfd45fd9511","resolution":{"observed_at":"2026-06-29T18:33:50.607869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2606.13304","last_updated":"2026-06-11T13:00:58Z","snapshot_observed_at":"2026-08-02T06:04:04.601953Z","submitted_at":"2026-06-11T13:00:58Z","title":"ReFree: Towards Realistic Co-Speech Video Generation via Reward-Free RL and Multilevel Speech Guidance","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T06:56:35.931176Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2606.13304"},"observation_digest":"sha256:8fc3cc6240aa0be0806227ebe4f82570147c537a8ff918f8e76ba56b03156d1e","observation_id":"802dd96e-2a18-45e5-94a0-861643019afd","resolution":{"observed_at":"2026-07-03T14:48:32.705373Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-02T07:09:08.026518Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:1f6c326fa2e4c2c7cee7fb76fa66bea9440fc4a887d14e55049a65a56437f65b","observation_id":"9adfd245-c7ea-4461-bb45-c772ba35572c","resolution":{"observed_at":"2026-06-30T06:44:19.552832Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2606.30849","last_updated":"2026-06-29T19:26:13Z","snapshot_observed_at":"2026-08-02T00:44:38.626792Z","submitted_at":"2026-06-29T19:26:13Z","title":"SyncCache: Exploiting Asymmetric Dynamics for Fast Audio-Driven Portrait Animation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-01T06:13:11.504526Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2606.30849"},"observation_digest":"sha256:c7fc2ed22142ad5e15aa8d408569e1ea997f5937471b56012a89d453e572df1e","observation_id":"abda8adc-4997-457f-95ab-4eb69b4bc66c","resolution":{"observed_at":"2026-07-01T09:45:40.338694Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2607.01222","last_updated":"2026-07-01T17:56:39Z","snapshot_observed_at":"2026-08-04T02:18:09.786163Z","submitted_at":"2026-07-01T17:56:39Z","title":"Ink3D: Sculpting 3D Assets with Extremely Complex Textures via Video Generative Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-02T13:16:16.676244Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2607.01222"},"observation_digest":"sha256:7c659c7d2c0d8a247a75f8aa403983ffe9eb48d8ca16c6552690f2054952bd89","observation_id":"e55d4727-a3f8-4397-a63d-f09874dc90a8","resolution":{"observed_at":"2026-07-02T13:16:58.093129Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-12T04:46:57.581402Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-06T11:22:14.847939Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T04:46:57.581402Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:16c7cadce1857abb8b05fc9697ef5414bc949375d2cd24e549f2adb44337c742","observation_id":"6500ddfb-d75d-4892-a023-fe235c500c26","resolution":{"observed_at":"2026-07-12T04:46:57.581402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-08-02T08:56:31.525012Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-06T11:22:14.847939Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.525012Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:95d441aa3133b6ac0cfa120645401bbea151a240760ffbb367758b79f89b052f","observation_id":"f9925a27-de13-409c-9838-6f113ba0d756","resolution":{"observed_at":"2026-08-02T08:56:31.525012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-13T01:59:43.167178Z","title":"arXiv preprint arXiv:2508.18621 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09581","last_updated":"2026-07-17T08:46:32Z","snapshot_observed_at":"2026-08-03T17:36:21.028438Z","submitted_at":"2026-07-10T16:30:29Z","title":"Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T01:59:43.167178Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2607.09581"},"observation_digest":"sha256:fee834cdb4fa2f4a42382ea9951cfbd15f534d7ead310ef3ee71c8000af58ff5","observation_id":"8d80c2af-be36-458f-a467-b2f597e4d5ab","resolution":{"observed_at":"2026-07-13T01:59:43.167178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-14T15:10:13.757131Z","title":"arXiv preprint arXiv:2508.18621 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09581","last_updated":"2026-07-17T08:46:32Z","snapshot_observed_at":"2026-08-03T17:36:21.028438Z","submitted_at":"2026-07-10T16:30:29Z","title":"Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T15:10:13.757131Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2607.09581"},"observation_digest":"sha256:8060524b9f225319a7203dff3876595ff3d0531fbfd73db91a3e3607ecde671a","observation_id":"96151756-fd25-4fe9-a567-e7ac1b8a8321","resolution":{"observed_at":"2026-07-14T15:10:13.757131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-08-02T07:35:22.880155Z","title":"arXiv preprint arXiv:2508.18621 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09581","last_updated":"2026-07-17T08:46:32Z","snapshot_observed_at":"2026-08-03T17:36:21.028438Z","submitted_at":"2026-07-10T16:30:29Z","title":"Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T07:35:22.880155Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2607.09581"},"observation_digest":"sha256:63a22c3d41c86aa7d414c8ee2f9c9150f7c494fa29c20dcf332450df6fe57a7e","observation_id":"0db1233f-e7bb-4a10-bb85-3d0ff1a05a65","resolution":{"observed_at":"2026-08-02T07:35:22.880155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-31T23:18:59.468371Z","title":"2508.18621 , archivePrefix=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-03T23:42:53.905682Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-31T23:18:59.468371Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:01a7bb1ca5b9483039c695fdbccf68058b4ef46b9c42d56937dedd8a57f426fb","observation_id":"51f7c75e-916d-4188-b3d9-db5c41a5be5a","resolution":{"observed_at":"2026-07-31T23:18:59.468371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-31T17:08:11.944416Z","title":"arXiv preprint arXiv:2508.18621 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-04T19:58:13.639778Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:11.944416Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:119d3e24c8aabbd7adec55adc3a3ace3c8b1d683146618c48b4648366c76a82a","observation_id":"32ba9d0c-e283-4059-9009-9515cc4f2452","resolution":{"observed_at":"2026-07-31T17:08:11.944416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-08-04T01:32:13.104187Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00079","last_updated":"2026-07-29T14:44:57Z","snapshot_observed_at":"2026-08-06T14:11:05.928357Z","submitted_at":"2026-07-29T14:44:57Z","title":"LeapTalk: Breaking the Latency-Quality Trade-off in Talking Head Generation","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-08-04T01:32:13.104187Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2608.00079"},"observation_digest":"sha256:c68ced1dcf87e2ca99de2231a1950be5ca2481a37cbb89416c55d09dc6f0a467","observation_id":"cbc871b1-6b14-47db-b6b1-2c0f3c82aaef","resolution":{"observed_at":"2026-08-04T01:32:13.104187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-08-04T06:45:46.515828Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-06T14:26:56.820375Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:46.515828Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:351925a4f81d302251e6a2d887e2c32313814db3406730813cf65ae6a2a2bc8c","observation_id":"afd2025c-a931-4640-a65e-51dd3c8b3371","resolution":{"observed_at":"2026-08-04T06:45:46.515828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.18621/citation-record","integrity":"/paper/2508.18621/integrity","json":"/paper/2508.18621/citation-record.json","paper":"/paper/2508.18621"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T16:24:58.584884Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T16:24:58.584884Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2508.18621"},"observation_digest":"sha256:665b48c10871712f8fdafbd7b6cec7ae0dfda7e491837f72c6d4e05431aa5706","observation_id":"4968f6d7-9c97-4a4f-b775-bba1ef82af99","resolution":{"observed_at":"2026-08-05T16:24:58.584884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T16:24:58.824740Z","title":"Hui Li, Mingwang Xu, Yun Zhan, Shan Mu, Jiaye Li, Kaihui Cheng, Yuxuan Chen, Tan Chen, Mao Ye, Jingdong Wang, and Siyu Zhu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T16:24:58.824740Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2508.18621"},"observation_digest":"sha256:98d4f9c5ac94cb3d3532f1b5e9575150ca24795402e91e656cc7567167601452","observation_id":"7fb76f94-98a9-4e52-b57a-a60ac840fe62","resolution":{"observed_at":"2026-08-05T16:24:58.824740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01061","last_updated":"2025-06-30T08:26:56Z","snapshot_observed_at":"2026-07-06T20:30:02.903743Z","submitted_at":"2025-02-03T05:17:32Z","title":"OmniHuman-1: Rethinking the Scaling-Up of One-Stage Conditioned Human Animation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01061","snapshot_observed_at":"2026-08-05T16:24:58.874741Z","title":"Yaron Lipman, Ricky T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T16:24:58.874741Z"},"links":{"cited_paper":"/paper/2502.01061","citing_paper":"/paper/2508.18621"},"observation_digest":"sha256:496b609cd5b65fe45d45766767d5b9d9a17dc8565e5204d2c1fd3c01d396ba99","observation_id":"04bda69f-6eb3-4468-bb05-9d351ea780ed","resolution":{"observed_at":"2026-08-05T16:24:58.874741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-07-06T20:22:50.018799Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10687","snapshot_observed_at":"2026-08-05T16:24:59.025790Z","title":"Emo2: End-effector guided audio- driven avatar video generation, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T16:24:59.025790Z"},"links":{"cited_paper":"/paper/2501.10687","citing_paper":"/paper/2508.18621"},"observation_digest":"sha256:d400ceb332a758e8257c62d7211fd82aea11eda3a4217eb99311f4cc54662530","observation_id":"6897fdfb-9ade-43ff-a776-5b1078b0f010","resolution":{"observed_at":"2026-08-05T16:24:59.025790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T16:24:59.084742Z","title":"Wan: Open and advanced large-scale video generative models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T16:24:59.084742Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2508.18621"},"observation_digest":"sha256:656929e816fc64e822b436ee5162487d4647e65c83e2e01a60da33a71a53e169","observation_id":"3ae816ba-4882-42a5-9c5f-4b5e41715aa9","resolution":{"observed_at":"2026-08-05T16:24:59.084742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04842","last_updated":"2025-04-07T08:56:01Z","snapshot_observed_at":"2026-07-06T21:05:20.266350Z","submitted_at":"2025-04-07T08:56:01Z","title":"FantasyTalking: Realistic Talking Portrait Generation via Coherent Motion Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04842","snapshot_observed_at":"2026-08-05T16:24:59.254749Z","title":"Fantasytalking: Realistic talking portrait generation via coherent motion syn- thesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T16:24:59.254749Z"},"links":{"cited_paper":"/paper/2504.04842","citing_paper":"/paper/2508.18621"},"observation_digest":"sha256:853549f6ff89f09388bfd6e0dfd496328b3cdea0b1df00b610c14fc34761c4a2","observation_id":"54d8d8a5-a960-4da1-b302-d210086694cd","resolution":{"observed_at":"2026-08-05T16:24:59.254749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08260","last_updated":"2025-04-26T17:58:24Z","snapshot_observed_at":"2026-08-01T11:16:30.883699Z","submitted_at":"2024-10-10T17:57:49Z","title":"Koala-36M: A Large-scale Video Dataset Improving Consistency between Fine-grained Conditions and Video Content","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08260","snapshot_observed_at":"2026-08-05T16:24:59.301375Z","title":"Zhou Wang, A.C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T16:24:59.301375Z"},"links":{"cited_paper":"/paper/2410.08260","citing_paper":"/paper/2508.18621"},"observation_digest":"sha256:74d869a5fc00885ee749fcc062f97dd5fb2dc17af268b72338fdba4dc46abd55","observation_id":"163e6c2f-8abb-466f-b17d-b21ee7be9c84","resolution":{"observed_at":"2026-08-05T16:24:59.301375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19680","last_updated":"2025-06-27T10:06:13Z","snapshot_observed_at":"2026-08-04T16:03:06.733403Z","submitted_at":"2024-06-28T06:40:53Z","title":"MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19680","snapshot_observed_at":"2026-08-05T16:24:59.444766Z","title":"Mimicmotion: High-quality human motion video generation with confidence-aware pose guid- ance","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T16:24:59.444766Z"},"links":{"cited_paper":"/paper/2406.19680","citing_paper":"/paper/2508.18621"},"observation_digest":"sha256:2fb33367c95501ef83b264d6cfa430db8f6af4c5bdbdb48c83e261fb2cb890d5","observation_id":"0ac0e266-00bd-4c76-9f87-ba7e83315f05","resolution":{"observed_at":"2026-08-05T16:24:59.444766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:24:59.354746Z","title":"Haoning Wu, Erli Zhang, Liang Liao, Chaofeng Chen, Jingwen Hou Hou, Annan Wang, Wenxiu Sun Sun, Qiong Yan, and Weisi Lin","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"reference_index":2004,"source":"pdf_text","source_observed_at":"2026-08-05T16:24:59.354746Z"},"links":{"citing_paper":"/paper/2508.18621"},"observation_digest":"sha256:b85411d787ac01af5828c6b37e5cdb7cc2a9f35f06debf81e75721c8a4f9ab03","observation_id":"13af52ce-5fa9-44ae-8acb-0f90b09b0c9c","resolution":{"observed_at":"2026-08-05T16:24:59.354746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:24:58.774990Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-05T16:24:58.774990Z"},"links":{"citing_paper":"/paper/2508.18621"},"observation_digest":"sha256:4f99a89fe3a3a864a3d26601d731a5e141e1fbbee487206f654d2b8e05f5f809","observation_id":"ca1bd54f-4053-41a3-b5f2-245a5bca4ded","resolution":{"observed_at":"2026-08-05T16:24:58.774990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:24:58.974740Z","title":"Christoph Schuhmann","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-05T16:24:58.974740Z"},"links":{"citing_paper":"/paper/2508.18621"},"observation_digest":"sha256:e179b5d4b7b7285ce4e583ca631ad95d2db04ea712c717e6edc44bf03dac93b5","observation_id":"b7516b7e-1033-429c-b33c-0060dd4bfa65","resolution":{"observed_at":"2026-08-05T16:24:58.974740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:25:01.954747Z","title":"Image quality metrics: Psnr vs","venue":null,"work_id":"dc933355-7415-4909-833c-21f192dc59e0","year":2010},"citing_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-05T16:24:58.724742Z"},"links":{"citing_paper":"/paper/2508.18621"},"observation_digest":"sha256:ddef6143078b1b6c24be70c74cac485a664e15732e98a58d3cba888dfebe0c7b","observation_id":"b29b68cb-f0fc-44d7-9b16-1208154a8507","resolution":{"observed_at":"2026-08-05T16:25:02.079683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.12484","last_updated":"2022-10-13T01:53:23Z","snapshot_observed_at":"2026-07-06T13:04:02.391482Z","submitted_at":"2022-04-26T17:55:04Z","title":"ViTPose: Simple Vision Transformer Baselines for Human Pose Estimation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.12484","snapshot_observed_at":"2026-08-05T16:24:59.404743Z","title":"Zhendong Yang, Ailing Zeng, Chun Yuan, and Yu Li","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T16:24:59.404743Z"},"links":{"cited_paper":"/paper/2204.12484","citing_paper":"/paper/2508.18621"},"observation_digest":"sha256:b81d5dabc5ceee2b58d1223b422cc022636073c7895c06af02b6bba769988e20","observation_id":"d77ea705-6962-4e0f-b2a1-7babb4f8852b","resolution":{"observed_at":"2026-08-05T16:24:59.404743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T16:24:58.924743Z","title":"Rang Meng, Xingyu Zhang, Yuming Li, and Chenguang Ma","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T16:24:58.924743Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2508.18621"},"observation_digest":"sha256:495ae33423d853e2512bbce1decffa96e07eaaf4b6dda39b9bd312f691fda9da","observation_id":"90c58207-0cbf-4150-bb93-e2f38d6b30c1","resolution":{"observed_at":"2026-08-05T16:24:58.924743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07719","last_updated":"2024-07-02T09:03:26Z","snapshot_observed_at":"2026-07-06T18:13:29.693360Z","submitted_at":"2024-05-13T13:08:02Z","title":"USP: A Unified Sequence Parallelism Approach for Long Context Generative AI","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07719","snapshot_observed_at":"2026-08-05T16:24:58.674741Z","title":"Martin Heusel, Hubert Ramsauer, Thomas Unterthiner, Bernhard Nessler, and Sepp Hochreiter","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T16:24:58.674741Z"},"links":{"cited_paper":"/paper/2405.07719","citing_paper":"/paper/2508.18621"},"observation_digest":"sha256:d7b67d4eb8af9ec6393c7ae1265ecdc7a412d8c1131390b97c61025267716e94","observation_id":"d377db72-a42b-49dc-a21b-bcd2603004dc","resolution":{"observed_at":"2026-08-05T16:24:58.674741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-07-06T21:30:46.863005Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-08-05T16:24:58.625126Z","title":"9 Joon Son Chung and Andrew Zisserman","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T16:24:58.625126Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2508.18621"},"observation_digest":"sha256:e3c141dc02eab48332125a703ef890c494c0a320ab5ce7fbeeb0a2b74b662a5e","observation_id":"3e091873-51f3-4079-b666-ccbce3d342bf","resolution":{"observed_at":"2026-08-05T16:24:58.625126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 32 inbound Pith citation observations for arXiv:2508.18621."}