{"as_of":"2026-08-08T18:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a62fc0c2ca9b647cfac98ab803002d5921fa6c442e3838d1fc746a9d788d665e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":38,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:59:32.071589Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T03:19:30.378145Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2503.07598","last_updated":"2025-03-11T06:44:25Z","snapshot_observed_at":"2026-07-06T20:50:05.070886Z","submitted_at":"2025-03-10T17:57:04Z","title":"VACE: All-in-One Video Creation and Editing","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T00:53:53.855965Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2503.07598"},"observation_digest":"sha256:2d1adf0f93827670bde604262871bd9021ab02429c97c0b991e190a20ecaaaac","observation_id":"e8ca3bea-1703-4a77-b703-ae6b0d629a7b","resolution":{"observed_at":"2026-05-16T00:53:54.003853Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2504.17816","last_updated":"2026-05-05T15:27:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-23T06:48:31Z","title":"Learning Zero-Shot Subject-Driven Video Generation Using 1% Compute","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-22T17:51:41.947939Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2504.17816"},"observation_digest":"sha256:c6483883f5dda8b964015d09379e546cac9c877274ce08155a1e0c7a8ee6fddd","observation_id":"dab58e75-016b-4c38-b61a-e1ac198ec9ce","resolution":{"observed_at":"2026-05-22T17:51:54.313500Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-07T13:59:32.071589Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:32.071589Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:c91e0af18095b26a97ab86cf32d833627270515562fa9effe32074a7a82b3a8a","observation_id":"8b4584ab-6c87-4bf6-a062-9600001f2d39","resolution":{"observed_at":"2026-08-07T13:59:32.071589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-07T11:12:10.052472Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:10.052472Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:aea4bbf7de48d6993dc7f896d448632c434f2cdcf1963aea41f3989b8dfb9a6d","observation_id":"820661d1-558e-4c66-b64a-1d735b45ff39","resolution":{"observed_at":"2026-08-07T11:12:10.052472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-07T05:30:32.974027Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T15:17:21.536011Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:32.974027Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:39f7b403b3a587b76215168ce4c5de2941b7dbb200f2eb28455578919fe9f212","observation_id":"e62295d4-8fa2-4396-8deb-fac1b7d52bf6","resolution":{"observed_at":"2026-08-07T05:30:32.974027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-07T04:27:39.046915Z","title":"Phan- tom: Subject-consistent video generation via cross- modal alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10568","last_updated":"2025-08-27T03:34:57Z","snapshot_observed_at":"2026-08-08T16:12:04.523586Z","submitted_at":"2025-06-12T10:58:23Z","title":"DreamActor-H1: High-Fidelity Human-Product Demonstration Video Generation via Motion-designed Diffusion Transformers","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:39.046915Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2506.10568"},"observation_digest":"sha256:b37339f0865f73c5430b902da9295d319cdd7b4ca54432f0eb1460e90c28a1dc","observation_id":"762ce83a-a2b1-4b2b-b0d3-7452fde4b615","resolution":{"observed_at":"2026-08-07T04:27:39.046915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-06T23:20:09.885970Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment.arXiv preprint arXiv:2502.11079, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-08T15:15:43.495121Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:09.885970Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:a582698c1cecee9d4509931f54937c57d4372a7afd506de8159c190872270b41","observation_id":"cde2f2fb-60aa-483a-8704-ee42bd252af6","resolution":{"observed_at":"2026-08-06T23:20:09.885970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-06T18:51:27.649430Z","title":"Phantom: Subject- consistent video generation via cross-modal alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-07T10:10:34.633901Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:27.649430Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:474fe491a178a891b0c90159cd85db9be06c99e96069ee614ff7993943ee8f70","observation_id":"78f0d332-7e44-4678-bd3e-d7f2777dd5a5","resolution":{"observed_at":"2026-08-06T18:51:27.649430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-06T16:39:36.070911Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12956","last_updated":"2025-07-17T09:50:43Z","snapshot_observed_at":"2026-08-07T23:26:25.424237Z","submitted_at":"2025-07-17T09:50:43Z","title":"FantasyPortrait: Enhancing Multi-Character Portrait Animation with Expression-Augmented Diffusion Transformers","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T16:39:36.070911Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2507.12956"},"observation_digest":"sha256:3ab85043af9073072cc10c8b67f156bb7df585d3ebbf3a657f8cef9583569c5a","observation_id":"5684ad4b-79c4-42a7-8685-928f47c503ff","resolution":{"observed_at":"2026-08-06T16:39:36.070911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-05T20:06:47.800330Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11255","last_updated":"2025-08-15T06:43:46Z","snapshot_observed_at":"2026-08-08T07:02:19.422958Z","submitted_at":"2025-08-15T06:43:46Z","title":"FantasyTalking2: Timestep-Layer Adaptive Preference Optimization for Audio-Driven Portrait Animation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:47.800330Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2508.11255"},"observation_digest":"sha256:a9c01c79c16e39b3a5da155bde7dd1e6805da30b9f83d1186dd58dedc42ccb56","observation_id":"d07100f1-754d-40de-b195-94151d481fd2","resolution":{"observed_at":"2026-08-05T20:06:47.800330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-05T12:42:40.992340Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01362","last_updated":"2025-09-01T11:03:13Z","snapshot_observed_at":"2026-08-08T04:43:05.738815Z","submitted_at":"2025-09-01T11:03:13Z","title":"Identity-Preserving Text-to-Video Generation via Training-Free Prompt, Image, and Guidance Enhancement","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T12:42:40.992340Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2509.01362"},"observation_digest":"sha256:6ac6ef34dc4a3196c54938c32cfb63b4f027ee27c245883d89a3d2383f97686a","observation_id":"eeeba291-e2d0-47b9-8c95-6822177149b3","resolution":{"observed_at":"2026-08-05T12:42:40.992340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-04T10:49:48.589583Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-07T16:29:46.498912Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:48.589583Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:56b6170164e5735aa80c234c07b1855d71c20f3a8a4a55fb921c00a6106a85fc","observation_id":"91ed0832-9ef6-4f2a-a878-5ce4e3355301","resolution":{"observed_at":"2026-08-04T10:49:48.589583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2511.22940","last_updated":"2026-05-19T15:28:34Z","snapshot_observed_at":"2026-08-02T05:15:20.627790Z","submitted_at":"2025-11-28T07:30:10Z","title":"One-to-All Animation: Alignment-Free Character Animation and Image Pose Transfer","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-21T18:25:22.486891Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2511.22940"},"observation_digest":"sha256:14b904f5e5d3db17ba55539ce73d1ff648c934f39bbf6d71907dcc17799aed6a","observation_id":"e5d041c1-8351-482f-9b6d-34fad7652cad","resolution":{"observed_at":"2026-05-21T18:25:28.396016Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-03T15:28:55.722892Z","title":"Phantom: Subject-consistent video generation via cross- modal alignment.arXiv preprint arXiv:2502.11079, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.17796","last_updated":"2026-06-24T08:52:20Z","snapshot_observed_at":"2026-08-06T07:44:38.380189Z","submitted_at":"2025-12-18T18:59:18Z","title":"CustomX: Unified Character, Action, and Scene Customization in Video World Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T15:28:55.722892Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2512.17796"},"observation_digest":"sha256:07092ebb02e580d01358b1431b2cc69d569bc58703f7954b37c48cc50d217a7d","observation_id":"b1e13b4c-d732-427f-b594-34f56251ba95","resolution":{"observed_at":"2026-08-03T15:28:55.722892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2602.13669","last_updated":"2026-04-22T07:41:44Z","snapshot_observed_at":"2026-07-06T22:45:53.926021Z","submitted_at":"2026-02-14T08:32:38Z","title":"EchoTorrent: Towards Swift, Sustained, and Streaming Multi-Modal Video Generation","version":5},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-15T22:20:16.320171Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2602.13669"},"observation_digest":"sha256:9ce043e3b31605de74574b2043e003a077c3dfc4be71a1d872f9c7b4a8b8cd17","observation_id":"04a016b9-f2f9-4cfa-a631-94fba03f29ea","resolution":{"observed_at":"2026-05-15T22:20:22.455970Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-04T05:51:18.232473Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.232473Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:ec1c8ce547e358be10607893b074b3a71e7a45555de4f581ded2049faca95ecc","observation_id":"b16c105f-f6af-4215-ad0b-6fb297f91cdc","resolution":{"observed_at":"2026-08-04T05:51:18.232473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2604.04934","last_updated":"2026-05-04T04:50:40Z","snapshot_observed_at":"2026-07-06T22:53:46.999911Z","submitted_at":"2026-04-06T17:59:59Z","title":"Vanast: Virtual Try-On with Human Image Animation via Synthetic Triplet Supervision","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T20:33:25.422350Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2604.04934"},"observation_digest":"sha256:424571d3f7d9f07f73bf7b62abc279a8eafd7f596a4b0bbbead8be0a83dd73c4","observation_id":"60704d15-2282-4390-b433-5a5fe85931b1","resolution":{"observed_at":"2026-05-10T21:55:49.210641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2604.06339","last_updated":"2026-04-07T18:17:05Z","snapshot_observed_at":"2026-07-06T22:54:53.308309Z","submitted_at":"2026-04-07T18:17:05Z","title":"Evolution of Video Generative Foundations","version":1},"reference_index":205,"source":"pdf_text","source_observed_at":"2026-05-10T18:41:38.616611Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2604.06339"},"observation_digest":"sha256:97006eda55ac41aebbed663d46407631eec13a29a375262143cc64e54ac470f1","observation_id":"a5ba3bef-7a30-4b49-b8ba-dfc6e2dd5f94","resolution":{"observed_at":"2026-05-11T00:05:51.328734Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2604.10030","last_updated":"2026-04-11T04:59:06Z","snapshot_observed_at":"2026-08-05T11:19:47.532677Z","submitted_at":"2026-04-11T04:59:06Z","title":"Prompt Relay: Inference-Time Temporal Control for Multi-Event Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T15:42:35.693519Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2604.10030"},"observation_digest":"sha256:54553c1c5f02d989d243e1007e884f2fe59836a82bdf3426ae083d0fab6a2249","observation_id":"d4177208-82fc-49ec-9bf1-bed27d5d2af9","resolution":{"observed_at":"2026-05-11T10:01:00.416886Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2604.11244","last_updated":"2026-04-15T07:55:01Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T09:50:36Z","title":"Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T15:07:45.595260Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2604.11244"},"observation_digest":"sha256:9e4a4e37b19a172856e70191116a1d5ef95429243e3215e4e42e9e03d35bc576","observation_id":"c5df77d7-6e3f-49ed-8acf-5e3c5ddccbe4","resolution":{"observed_at":"2026-05-11T11:11:03.692220Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":1},"reference_index":141,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:33.264166Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:b2a4d150d3900c345637b13f21e23afbf39f6500e0d09abdb7f632a7817b8f17","observation_id":"8990056c-c55a-4965-b135-a1b03ef9f68b","resolution":{"observed_at":"2026-05-11T08:30:56.950219Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":120,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:af663da6b541dee353074a5e5d80be38c10f758d920e5bf823904bc69aa47122","observation_id":"a504db6f-6ef3-4462-bd37-eae9a89ad9b7","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-08-06T16:53:42.723002Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:62189b80faa44f12f965dc50ee724984ef3d54bf0dae197efdac9fa70a001ea7","observation_id":"78cd8348-c81b-4c6c-8519-b0c3160d0004","resolution":{"observed_at":"2026-05-11T11:06:05.893388Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2604.19720","last_updated":"2026-04-21T17:47:26Z","snapshot_observed_at":"2026-07-06T23:06:16.972438Z","submitted_at":"2026-04-21T17:47:26Z","title":"ReImagine: Rethinking Controllable High-Quality Human Video Generation via Image-First Synthesis","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T02:24:57.882447Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2604.19720"},"observation_digest":"sha256:551b2bd0165ba986bb839eae37e903e86eb96fa3b538769ad8a26bcc5bd4ca15","observation_id":"8020a8c1-a8f7-4b1e-bd94-51dde555e8a1","resolution":{"observed_at":"2026-05-11T13:01:26.592322Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:fb6e7b03f1655db2f40d51234c0a8aa5e00810ce918a5efe87ab4d8c598eb1a2","observation_id":"9c0c0c03-b5a1-479c-bb2b-3fd35485b6c0","resolution":{"observed_at":"2026-05-11T17:21:09.635204Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2605.15824","last_updated":"2026-06-17T15:16:37Z","snapshot_observed_at":"2026-08-03T19:41:20.540916Z","submitted_at":"2026-05-15T10:25:06Z","title":"FashionChameleon: Towards Real-Time and Interactive Human-Garment Video Customization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T20:11:33.277349Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2605.15824"},"observation_digest":"sha256:d50d09c8ddef75e02ba1f002fdb757b42584733bf4331e30e4ff45f743c12719","observation_id":"871d318c-ba5c-438c-ae15-f110cd8a7bac","resolution":{"observed_at":"2026-05-20T20:13:43.610050Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2605.15824","last_updated":"2026-06-17T15:16:37Z","snapshot_observed_at":"2026-08-03T19:41:20.540916Z","submitted_at":"2026-05-15T10:25:06Z","title":"FashionChameleon: Towards Real-Time and Interactive Human-Garment Video Customization","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T19:23:07.044659Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2605.15824"},"observation_digest":"sha256:d02006f3eda2ff4d141b13697222372aa74bfc4d85c4fe4f8296d65a5a23078e","observation_id":"66e35ba8-be81-4f43-982a-63b0a576b155","resolution":{"observed_at":"2026-06-30T19:25:00.562996Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2605.22344","last_updated":"2026-05-21T11:30:29Z","snapshot_observed_at":"2026-07-06T23:32:39.761431Z","submitted_at":"2026-05-21T11:30:29Z","title":"Bernini: Latent Semantic Planning for Video Diffusion","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-22T06:39:47.124605Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2605.22344"},"observation_digest":"sha256:c5be61c9abccfccb9487cb40521a56b3289accc6d609e6b7041e3dcafbc709e7","observation_id":"b6a1476b-f6fc-4200-b0fc-087b41a9a896","resolution":{"observed_at":"2026-05-22T06:41:10.542258Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2605.23610","last_updated":"2026-05-22T13:20:29Z","snapshot_observed_at":"2026-08-08T10:04:13.494103Z","submitted_at":"2026-05-22T13:20:29Z","title":"EM-Vid: Training-Free Entity-Centric Memory for Efficient and Consistent Multi-Shot Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-25T04:57:13.479165Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2605.23610"},"observation_digest":"sha256:8ac68e75ea45edcec5f16ab7c58d2454b29275014cd4ffd648ab6d80397f71e1","observation_id":"048d38ed-a3bc-4ad6-a5c0-aa4a4bded87a","resolution":{"observed_at":"2026-05-25T05:00:22.425250Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:00ea7e32e0dd2636ce1e740a9537c9d293144fab6665b58649b512939521e1ae","observation_id":"54d0a592-7bba-47d0-b7f3-a32634311248","resolution":{"observed_at":"2026-07-01T22:56:20.244659Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2606.07508","last_updated":"2026-06-05T17:57:32Z","snapshot_observed_at":"2026-08-03T10:42:24.485829Z","submitted_at":"2026-06-05T17:57:32Z","title":"Streaming Video Generation with Streaming Force Control","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T22:14:32.465663Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2606.07508"},"observation_digest":"sha256:28d64a5fc3d852c1490d78fc3d6690b6de6e24639a56c5990d5114cc2099bbaf","observation_id":"610c77d1-d687-469a-abaf-59b53dac25f1","resolution":{"observed_at":"2026-07-02T17:07:12.387385Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2606.10839","last_updated":"2026-06-22T14:44:53Z","snapshot_observed_at":"2026-08-08T03:14:09.273162Z","submitted_at":"2026-06-09T13:26:39Z","title":"HarmoView: Harmonizing Multi-View Constraints for Identity-Consistent Video Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T13:49:50.272650Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2606.10839"},"observation_digest":"sha256:5b0037b5f2dd7ab36f1bd590e44639e1911f57ffde31d6da1028e6632867d6d1","observation_id":"f48bf4c6-21ea-43b5-b88f-86cac9cca637","resolution":{"observed_at":"2026-07-03T04:37:36.648289Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2606.11670","last_updated":"2026-06-10T05:29:09Z","snapshot_observed_at":"2026-08-07T07:14:38.415101Z","submitted_at":"2026-06-10T05:29:09Z","title":"ARGUS: Stacked Multi-View Identity Mosaic Injection for Subject-Preserving Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T10:46:56.871174Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2606.11670"},"observation_digest":"sha256:31882223245b6f2720e902de751af9096701e7eead6012538b00ce756c4675e6","observation_id":"24afdf48-3e48-4b2e-a930-603545850b29","resolution":{"observed_at":"2026-07-03T08:17:45.947052Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2606.20799","last_updated":"2026-07-15T15:45:17Z","snapshot_observed_at":"2026-08-02T10:48:03.144592Z","submitted_at":"2026-06-18T18:00:03Z","title":"GroundShot: Visually Consistent Multi-Shot Long Video Generation via Entity-Grounded Shot Scheduling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T18:15:51.862192Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2606.20799"},"observation_digest":"sha256:cfd5b05cf843e523fb897995f784ecf7e4ec8731db580b3f6af0608204d7431f","observation_id":"68f86b7d-16e3-4865-a3fa-70fb1297d568","resolution":{"observed_at":"2026-07-04T03:19:30.381652Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-02T10:48:05.537673Z","title":"Phantom: Subject-consistent video generation via cross- modal alignment.arXiv preprint arXiv:2502.11079, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20799","last_updated":"2026-07-15T15:45:17Z","snapshot_observed_at":"2026-08-02T10:48:03.144592Z","submitted_at":"2026-06-18T18:00:03Z","title":"GroundShot: Visually Consistent Multi-Shot Long Video Generation via Entity-Grounded Shot Scheduling","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T10:48:05.537673Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2606.20799"},"observation_digest":"sha256:4122ba5ae4854cfb6bdec205e025eab096d670683da181c47d57a39e227ced54","observation_id":"73bda7db-f3f1-424c-89bf-43f5dcb8f4a5","resolution":{"observed_at":"2026-08-02T10:48:05.537673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2606.28531","last_updated":"2026-06-26T18:30:00Z","snapshot_observed_at":"2026-07-07T00:02:38.226622Z","submitted_at":"2026-06-26T18:30:00Z","title":"A Good Talk Does not Look Like a Summary, It Teaches You! Measuring Takeaways from Paper-to-Video Talks","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-30T00:59:50.478584Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2606.28531"},"observation_digest":"sha256:28afb4c3d8e4709c20fb7f368873d13148fa7fd1d0f36e20a70f828299724359","observation_id":"ecf247e4-33a2-4343-bb22-f847989a56a7","resolution":{"observed_at":"2026-07-01T15:45:48.892408Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-01T16:30:02.172800Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17985","last_updated":"2026-07-20T14:16:49Z","snapshot_observed_at":"2026-08-08T15:15:32.999700Z","submitted_at":"2026-07-20T14:16:49Z","title":"Keyframe-Anchored Identity Preservation for Sequential-Action Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T16:30:02.172800Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2607.17985"},"observation_digest":"sha256:b3e90f5256ef528ac7d465055f9d55c86e68d6d39734e2551584d2a2cf926d77","observation_id":"95c4ed9a-fded-45a9-8f3e-332d66048293","resolution":{"observed_at":"2026-08-01T16:30:02.172800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-01T04:27:31.566712Z","title":"arXiv preprint arXiv:2502.11079 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22830","last_updated":"2026-07-24T18:12:58Z","snapshot_observed_at":"2026-08-08T06:26:12.527056Z","submitted_at":"2026-07-24T18:12:58Z","title":"ID-V2V: Identity-Preserving Video Restylization","version":1},"reference_index":191,"source":"arxiv_source","source_observed_at":"2026-08-01T04:27:31.566712Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2607.22830"},"observation_digest":"sha256:d15024483141070dca46eef13a6b1ec044bd7de70d1c1cb3533b1fdae24f766e","observation_id":"d111140e-0430-4dbc-a018-a4527dfbfc31","resolution":{"observed_at":"2026-08-01T04:27:31.566712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.11079/citation-record","integrity":"/paper/2502.11079/integrity","json":"/paper/2502.11079/citation-record.json","paper":"/paper/2502.11079"},"outbound":[],"paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 38 inbound Pith citation observations for arXiv:2502.11079."}