{"as_of":"2026-08-09T03:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9d910363d93f9062c26bf6838b38f51e4e6738a37769fd04c300a560cecfe9e6","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":38,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T12:16:44.665393Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T21:10:09.669744Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-08-07T15:43:30.549695Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14135","last_updated":"2025-05-28T13:11:02Z","snapshot_observed_at":"2026-08-08T15:14:56.532724Z","submitted_at":"2025-05-20T09:39:48Z","title":"Hunyuan-Game: Industrial-grade Intelligent Game Creation Model","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:30.549695Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2505.14135"},"observation_digest":"sha256:8636fc31d3131fb58dd5584226686c0e03b288fdaf51399ceafeea6e5d66fed0","observation_id":"8dd27455-0272-48ec-a382-50a76bb3bf6f","resolution":{"observed_at":"2026-08-07T15:43:30.549695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-08-07T13:59:30.485928Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:30.485928Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:b7375dcd4d4e8054bec5c87fbe95a05921baf7ba45e3c65ca72980e0765811f6","observation_id":"63e9d5a2-120e-4bf2-8687-2cb8e04ecf70","resolution":{"observed_at":"2026-08-07T13:59:30.485928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-08-07T11:39:51.666724Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01801","last_updated":"2025-06-02T15:42:06Z","snapshot_observed_at":"2026-08-08T20:24:18.281655Z","submitted_at":"2025-06-02T15:42:06Z","title":"OmniV2V: Versatile Video Generation and Editing via Dynamic Content Manipulation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:39:51.666724Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2506.01801"},"observation_digest":"sha256:8508f3863ad8a79f79bba8e5e265ea54542efb3c4492b2823f8ed6c3dbaa865b","observation_id":"abfbb6ad-57e0-46c4-8e59-66bedea81e69","resolution":{"observed_at":"2026-08-07T11:39:51.666724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-08-07T05:30:32.934408Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:32.934408Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:496eb85992a6280f2f0b1afc0cb57586b87f35b90ae28568a9f4445aef16677a","observation_id":"788063b8-c336-4922-8764-25d8cbfc7f70","resolution":{"observed_at":"2026-08-07T05:30:32.934408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-08-07T04:27:37.363932Z","title":"Hunyuancus- tom: A multimodal-driven architecture for customized video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10568","last_updated":"2025-08-27T03:34:57Z","snapshot_observed_at":"2026-08-08T16:12:04.523586Z","submitted_at":"2025-06-12T10:58:23Z","title":"DreamActor-H1: High-Fidelity Human-Product Demonstration Video Generation via Motion-designed Diffusion Transformers","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:37.363932Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2506.10568"},"observation_digest":"sha256:c162a46e84527e184e19c6eb73f30aa7f650ab7d9c83beead1e23f3c1ab71dca","observation_id":"074be566-ef03-4cca-86e2-8188ae16870a","resolution":{"observed_at":"2026-08-07T04:27:37.363932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-08-06T23:20:09.055319Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video generation.arXiv preprint arXiv:2505.04512, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-08T15:15:43.495121Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:09.055319Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:aae5c27e8887aab644d7cadda8ab11c6b5a96a6a17b47b47101723c4696fd668","observation_id":"4fe3aad9-1022-4d98-a760-24ab29b51e31","resolution":{"observed_at":"2026-08-06T23:20:09.055319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-08-06T18:51:26.356204Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video gen- eration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-07T10:10:34.633901Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:26.356204Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:e56835cf0abf3e1b4ddf715cdb191c7e1e504f671db21a75a54fe507259ed9f9","observation_id":"b641c452-348b-4b38-88ec-e82f018c0546","resolution":{"observed_at":"2026-08-06T18:51:26.356204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-08-05T18:34:25.012542Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.14465","last_updated":"2025-08-20T06:40:34Z","snapshot_observed_at":"2026-08-07T20:12:58.792553Z","submitted_at":"2025-08-20T06:40:34Z","title":"DreamSwapV: Mask-guided Subject Swapping for Any Customized Video Editing","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T18:34:25.012542Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2508.14465"},"observation_digest":"sha256:4762741d7cc9c323689f56e72c8edf1989ca974568d6671c78ada3daca6fbbca","observation_id":"0a61444a-cf7f-48d6-94ed-a824c5c1e72d","resolution":{"observed_at":"2026-08-05T18:34:25.012542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-08-03T15:20:18.764867Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video gener- ation.arXiv preprint arXiv:2505.04512, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.17504","last_updated":"2026-06-29T14:03:15Z","snapshot_observed_at":"2026-08-08T15:15:50.787418Z","submitted_at":"2025-12-19T12:14:36Z","title":"InsertAnywhere: Geometrically Grounded and Optics-Aware Video Object Insertion","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T15:20:18.764867Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2512.17504"},"observation_digest":"sha256:3f2a5658a31b4f90b90b8cd848cf3e8aac8097ce13b8cc6ff8008a89f63be92c","observation_id":"812b033c-b4c9-46d7-a44b-6d9dd7a06258","resolution":{"observed_at":"2026-08-03T15:20:18.764867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-08-03T15:28:52.239638Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video gen- eration.arXiv preprint arXiv:2505.04512, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.17796","last_updated":"2026-06-24T08:52:20Z","snapshot_observed_at":"2026-08-06T07:44:38.380189Z","submitted_at":"2025-12-18T18:59:18Z","title":"CustomX: Unified Character, Action, and Scene Customization in Video World Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T15:28:52.239638Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2512.17796"},"observation_digest":"sha256:6c6390a4cd4ac144f5dce2a6eab82e4921ca8517b942d41fd28986ecdc818fd4","observation_id":"e5bf8773-d8bb-4ee5-9162-fd11c56f9371","resolution":{"observed_at":"2026-08-03T15:28:52.239638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-08-03T00:11:12.422942Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video gener- ation.arXiv preprint arXiv:2505.04512, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12304","last_updated":"2026-07-23T11:24:08Z","snapshot_observed_at":"2026-08-03T00:11:08.466564Z","submitted_at":"2026-02-12T03:25:41Z","title":"OmniCustom: Sync Audio-Video Customization Via Joint Audio-Video Generation Model","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T00:11:12.422942Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2602.12304"},"observation_digest":"sha256:3459a384e2b1fdfc950d70cfe52fb6a1fc7523721ad388da75a8010cf57831d1","observation_id":"6ee46033-c95f-4400-813a-8b67dfa1477b","resolution":{"observed_at":"2026-08-03T00:11:12.422942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-08-04T05:51:18.169044Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.169044Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:a2910f9878817f7ab021fdf568d86e3e702f086728e77b19d5d381378bacf752","observation_id":"c97ce011-c67f-4cbf-a1d6-0403d5d9fecc","resolution":{"observed_at":"2026-08-04T05:51:18.169044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-07-13T18:01:19.034578Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video generation.arXiv preprint arXiv:2505.04512, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.25743","last_updated":"2026-06-29T08:23:47Z","snapshot_observed_at":"2026-08-08T15:15:46.111735Z","submitted_at":"2026-03-26T17:59:57Z","title":"RefAlign: Representation Alignment for Reference-to-Video Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-13T18:01:19.034578Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2603.25743"},"observation_digest":"sha256:e533cc29bc018459e773989793330075b266fa7cce3635e4eaadf0eb8efa66ed","observation_id":"d24af3bf-84ac-43b0-ae30-3b1dd448ad90","resolution":{"observed_at":"2026-07-13T18:01:19.034578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-07-13T12:23:05.876881Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video gener- ation.arXiv preprint arXiv:2505.04512, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03738","last_updated":"2026-04-04T13:50:38Z","snapshot_observed_at":"2026-08-06T04:04:52.686841Z","submitted_at":"2026-04-04T13:50:38Z","title":"Rethinking Position Embedding as a Context Controller for Multi-Reference and Multi-Shot Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T12:23:05.876881Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2604.03738"},"observation_digest":"sha256:0c6d856039674acadc815427e73ff9aa60e30db8deb9ad3eb06a1856c63cc6b8","observation_id":"e4ce79ab-ccc8-420b-b23d-c466bd122994","resolution":{"observed_at":"2026-07-13T12:23:05.876881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":"2505.04512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-07-04T21:10:09.669744Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video generation","venue":null,"work_id":"206c3d53-d8c1-441e-a421-19e52b8080c4","year":2025},"citing_paper":{"arxiv_id":"2604.06339","last_updated":"2026-04-07T18:17:05Z","snapshot_observed_at":"2026-07-06T22:54:53.308309Z","submitted_at":"2026-04-07T18:17:05Z","title":"Evolution of Video Generative Foundations","version":1},"reference_index":204,"source":"pdf_text","source_observed_at":"2026-05-10T18:41:38.616611Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2604.06339"},"observation_digest":"sha256:588ecf569c5e9c57e592220327f7898c628faa9cb3a1ffc52c7d05a8b6b0b0f0","observation_id":"0163d288-73d9-4b31-97ba-08b701df773b","resolution":{"observed_at":"2026-05-11T00:05:51.753975Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":"2505.04512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-07-04T21:10:09.669744Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video generation","venue":null,"work_id":"206c3d53-d8c1-441e-a421-19e52b8080c4","year":2025},"citing_paper":{"arxiv_id":"2604.10030","last_updated":"2026-04-11T04:59:06Z","snapshot_observed_at":"2026-08-05T11:19:47.532677Z","submitted_at":"2026-04-11T04:59:06Z","title":"Prompt Relay: Inference-Time Temporal Control for Multi-Event Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T15:42:35.693519Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2604.10030"},"observation_digest":"sha256:8384fa424802a15d0adf47235dcd4f7dc7e6d1b8b000f52ef12e8d99e575298f","observation_id":"04fe287e-dfd8-4469-bcbb-8a9e6bc57b04","resolution":{"observed_at":"2026-05-11T10:01:00.395392Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":"2505.04512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-07-04T21:10:09.669744Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video generation","venue":null,"work_id":"206c3d53-d8c1-441e-a421-19e52b8080c4","year":2025},"citing_paper":{"arxiv_id":"2604.11244","last_updated":"2026-04-15T07:55:01Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T09:50:36Z","title":"Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T15:07:45.595260Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2604.11244"},"observation_digest":"sha256:8c38a904b19eb92e024b5d155c40ddd66c1fa1ed71bdc52f87a1db062c3b7eff","observation_id":"f08526f3-b1aa-49ac-a63c-5947baa19432","resolution":{"observed_at":"2026-05-11T11:11:03.662032Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":"2505.04512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-07-04T21:10:09.669744Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video generation","venue":null,"work_id":"206c3d53-d8c1-441e-a421-19e52b8080c4","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-08-06T16:53:42.723002Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:9616c226d31645c73de535b37eea73d4e76869d9207562b5a29663dd837281b2","observation_id":"c1d8d2a0-a7d1-48f9-9bb7-bff428615352","resolution":{"observed_at":"2026-05-11T11:11:00.806138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":"2505.04512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-07-04T21:10:09.669744Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video generation","venue":null,"work_id":"206c3d53-d8c1-441e-a421-19e52b8080c4","year":2025},"citing_paper":{"arxiv_id":"2604.14556","last_updated":"2026-04-16T02:39:15Z","snapshot_observed_at":"2026-07-06T23:02:18.425249Z","submitted_at":"2026-04-16T02:39:15Z","title":"Controllable Video Object Insertion via Multiview Priors","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T11:44:17.033051Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2604.14556"},"observation_digest":"sha256:ff882df1d428f0b91e48977a423d566a462a30161f1511cdaf2292b971fcf9ee","observation_id":"952199a1-ebad-4157-a3ce-83405553fdcc","resolution":{"observed_at":"2026-05-10T11:45:20.706056Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":"2505.04512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-07-04T21:10:09.669744Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video generation","venue":null,"work_id":"206c3d53-d8c1-441e-a421-19e52b8080c4","year":2025},"citing_paper":{"arxiv_id":"2604.19473","last_updated":"2026-04-21T13:56:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-21T13:56:36Z","title":"TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T02:45:10.577070Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2604.19473"},"observation_digest":"sha256:afe5247239268db60f77fd916fc85416ec1d9f4dfa9c0d1a32b57ae3008b16ac","observation_id":"65333d83-84de-4bec-87d3-da71d12a5d45","resolution":{"observed_at":"2026-05-10T02:53:29.903427Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":"2505.04512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-07-04T21:10:09.669744Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video generation","venue":null,"work_id":"206c3d53-d8c1-441e-a421-19e52b8080c4","year":2025},"citing_paper":{"arxiv_id":"2604.19679","last_updated":"2026-06-29T16:38:23Z","snapshot_observed_at":"2026-07-06T23:06:16.972438Z","submitted_at":"2026-04-21T16:57:23Z","title":"MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T02:55:09.008954Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2604.19679"},"observation_digest":"sha256:263ace49b2dbc682ddb20b9e50151243a171954714165e68e7c140293e8a618f","observation_id":"eacb0a72-0353-47e2-931e-c83cd4fbc94b","resolution":{"observed_at":"2026-05-11T12:46:28.018405Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":"2505.04512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-07-04T21:10:09.669744Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video generation","venue":null,"work_id":"206c3d53-d8c1-441e-a421-19e52b8080c4","year":2025},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:73f53ea72456bbd53b91b52c42f82818694dbc5c8b364a7d19697d8c0d28c43d","observation_id":"f3ac5160-9ad1-4dfb-b028-b606168c8028","resolution":{"observed_at":"2026-05-11T17:21:09.751609Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":"2505.04512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-07-04T21:10:09.669744Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video generation","venue":null,"work_id":"206c3d53-d8c1-441e-a421-19e52b8080c4","year":2025},"citing_paper":{"arxiv_id":"2605.12088","last_updated":"2026-05-13T15:41:37Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T13:10:05Z","title":"UniCustom: Unified Visual Conditioning for Multi-Reference Image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T05:53:21.851578Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2605.12088"},"observation_digest":"sha256:2baa9a08ae006498d1319a1f8c223414a0214d11fc80bf2c1675468405bf8689","observation_id":"d89586ac-4a70-4d6b-8094-c6a6994a90a8","resolution":{"observed_at":"2026-05-13T06:02:23.937729Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":"2505.04512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-07-04T21:10:09.669744Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video generation","venue":null,"work_id":"206c3d53-d8c1-441e-a421-19e52b8080c4","year":2025},"citing_paper":{"arxiv_id":"2605.12088","last_updated":"2026-05-13T15:41:37Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T13:10:05Z","title":"UniCustom: Unified Visual Conditioning for Multi-Reference Image Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-14T22:00:01.349754Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2605.12088"},"observation_digest":"sha256:abc64cc993c6fbe17fd984c5095d73baf77c8d701f5665390f3f2cf72f383539","observation_id":"586ba538-ab1b-4b26-8fe9-2a6b78fff3c1","resolution":{"observed_at":"2026-05-14T22:03:03.463171Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":"2505.04512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-07-04T21:10:09.669744Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video generation","venue":null,"work_id":"206c3d53-d8c1-441e-a421-19e52b8080c4","year":2025},"citing_paper":{"arxiv_id":"2605.17488","last_updated":"2026-05-17T14:56:52Z","snapshot_observed_at":"2026-08-04T04:39:45.061732Z","submitted_at":"2026-05-17T14:56:52Z","title":"Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T14:08:30.802619Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2605.17488"},"observation_digest":"sha256:04b86be08fe0bd8381c83fe6c0f7433686761bf7b10bfbb111e3b466d7a7bbe6","observation_id":"0f54d741-72e8-4725-929e-dbc3f06fb308","resolution":{"observed_at":"2026-05-20T14:13:21.373265Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":"2505.04512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-07-04T21:10:09.669744Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video generation","venue":null,"work_id":"206c3d53-d8c1-441e-a421-19e52b8080c4","year":2025},"citing_paper":{"arxiv_id":"2606.02441","last_updated":"2026-06-01T16:12:18Z","snapshot_observed_at":"2026-08-08T05:56:53.706139Z","submitted_at":"2026-06-01T16:12:18Z","title":"Spatial-Temporal Decoupled Reference Conditioning for Identity-Preserving Text-to-Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T15:25:22.778550Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2606.02441"},"observation_digest":"sha256:23ec26989405290745ef2e3f5696e420df9b9f0ec183a103d2add4734e577d0b","observation_id":"2af97305-875a-456f-9aab-b10078e1f81f","resolution":{"observed_at":"2026-07-01T22:26:17.501082Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":"2505.04512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-07-04T21:10:09.669744Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video generation","venue":null,"work_id":"206c3d53-d8c1-441e-a421-19e52b8080c4","year":2025},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:9f6f347394651926b75861d94ad8703df320133178eab725c16a928fc278b5db","observation_id":"a795f952-7525-4266-a9d2-855d4aa99514","resolution":{"observed_at":"2026-07-01T22:56:20.256912Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":"2505.04512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-07-04T21:10:09.669744Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video generation","venue":null,"work_id":"206c3d53-d8c1-441e-a421-19e52b8080c4","year":2025},"citing_paper":{"arxiv_id":"2606.09639","last_updated":"2026-06-11T05:58:22Z","snapshot_observed_at":"2026-08-02T02:07:05.154330Z","submitted_at":"2026-06-08T15:35:51Z","title":"CineDance: Towards Next-Generation Multi-Shot Long-Form Cinematic Audio-Video Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T17:30:25.371658Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2606.09639"},"observation_digest":"sha256:d30b658f4aae6155b61f4c9e6154de3b71ef10f5ce6f1120f2f93d80ca492e1e","observation_id":"e690e724-3c34-452d-9f64-4b51f8002a07","resolution":{"observed_at":"2026-07-03T00:07:28.122494Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":"2505.04512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-07-04T21:10:09.669744Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video generation","venue":null,"work_id":"206c3d53-d8c1-441e-a421-19e52b8080c4","year":2025},"citing_paper":{"arxiv_id":"2606.10839","last_updated":"2026-06-22T14:44:53Z","snapshot_observed_at":"2026-08-08T03:14:09.273162Z","submitted_at":"2026-06-09T13:26:39Z","title":"HarmoView: Harmonizing Multi-View Constraints for Identity-Consistent Video Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T13:49:50.272650Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2606.10839"},"observation_digest":"sha256:dfebd07e812e66a5bd1b36fcad226433976c8a3b4442d8a4cd0cd3932191467f","observation_id":"8d18100d-2885-40e1-892b-3bdca5f5cedb","resolution":{"observed_at":"2026-07-03T04:37:36.656864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":"2505.04512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-07-04T21:10:09.669744Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video generation","venue":null,"work_id":"206c3d53-d8c1-441e-a421-19e52b8080c4","year":2025},"citing_paper":{"arxiv_id":"2606.11670","last_updated":"2026-06-10T05:29:09Z","snapshot_observed_at":"2026-08-07T07:14:38.415101Z","submitted_at":"2026-06-10T05:29:09Z","title":"ARGUS: Stacked Multi-View Identity Mosaic Injection for Subject-Preserving Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T10:46:56.871174Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2606.11670"},"observation_digest":"sha256:985e6b9ec68bffc207d2bba0b680bfd784362df1b03575c4f205a9814b57e430","observation_id":"0c8b23d7-dc6d-456c-9fb3-b8ba38c205fc","resolution":{"observed_at":"2026-07-03T08:17:45.961436Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":"2505.04512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-07-04T21:10:09.669744Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video generation","venue":null,"work_id":"206c3d53-d8c1-441e-a421-19e52b8080c4","year":2025},"citing_paper":{"arxiv_id":"2606.26058","last_updated":"2026-06-24T17:33:13Z","snapshot_observed_at":"2026-08-07T10:26:25.230801Z","submitted_at":"2026-06-24T17:33:13Z","title":"DomainShuttle: Freeform Open Domain Subject-driven Text-to-video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-25T19:00:23.260939Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2606.26058"},"observation_digest":"sha256:5e94297266f9fcc205f6f440687615ef719063a1c60ca0bc4126e21deba2ddda","observation_id":"7f39caec-ed05-4f26-aee3-ac525f169cd6","resolution":{"observed_at":"2026-07-04T21:10:09.671686Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":"2505.04512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-07-04T21:10:09.669744Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video generation","venue":null,"work_id":"206c3d53-d8c1-441e-a421-19e52b8080c4","year":2025},"citing_paper":{"arxiv_id":"2607.01222","last_updated":"2026-07-01T17:56:39Z","snapshot_observed_at":"2026-08-04T02:18:09.786163Z","submitted_at":"2026-07-01T17:56:39Z","title":"Ink3D: Sculpting 3D Assets with Extremely Complex Textures via Video Generative Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-02T13:16:16.676244Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2607.01222"},"observation_digest":"sha256:3e0b8691c669952bb10e7a8b67e1ce9bbd3b91533dcbe921f5dd12183d99823b","observation_id":"bf6267c4-094e-4ab3-9066-b21b8598b93f","resolution":{"observed_at":"2026-07-02T13:16:58.123698Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-07-11T20:11:31.576642Z","title":"arXiv preprint arXiv:2505.04512 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04311","last_updated":"2026-07-07T14:30:21Z","snapshot_observed_at":"2026-08-04T12:36:41.280283Z","submitted_at":"2026-07-05T13:54:33Z","title":"Aura: Consistent Multi-Subject Video Generation via VLM-Grounded Semantic Alignment","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-11T20:11:31.576642Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2607.04311"},"observation_digest":"sha256:5d86447036f4ab812df6dddf3c5a93c8c205bb2e0d433af5c6b49b957826487e","observation_id":"fd6a0b46-6194-4af3-baa6-6848e97a5470","resolution":{"observed_at":"2026-07-11T20:11:31.576642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-08-01T16:30:01.157173Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17985","last_updated":"2026-07-20T14:16:49Z","snapshot_observed_at":"2026-08-08T15:15:32.999700Z","submitted_at":"2026-07-20T14:16:49Z","title":"Keyframe-Anchored Identity Preservation for Sequential-Action Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T16:30:01.157173Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2607.17985"},"observation_digest":"sha256:f26c336a82db3b0190da3650fe3041866798c8907d5576a2da73b6d39d68f410","observation_id":"63374138-3231-45c3-9427-fbcf3959b7d1","resolution":{"observed_at":"2026-08-01T16:30:01.157173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-08-01T15:42:20.695859Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video generation.arXiv preprint arXiv:2505.04512, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18217","last_updated":"2026-07-21T02:55:50Z","snapshot_observed_at":"2026-08-08T15:15:45.449643Z","submitted_at":"2026-07-20T17:51:35Z","title":"HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enhancement","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:20.695859Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2607.18217"},"observation_digest":"sha256:cb8e10326cc08e97b164669bcec096cb73e28e81b8fcde8f39883f3337c9eb1e","observation_id":"18cd2add-2d16-4bc1-8d33-4e7a7b66130b","resolution":{"observed_at":"2026-08-01T15:42:20.695859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-08-04T17:55:19.705417Z","title":"arXiv preprint arXiv:2505.04512 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.705417Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:4863a58e5489b01d6bf00e8c38b4fe641b8087f5322404e6b8b37cceec33db0f","observation_id":"f34af647-a454-47b8-99ea-6fd7f628fb95","resolution":{"observed_at":"2026-08-04T17:55:19.705417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-08-08T12:16:44.665393Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video gener- ation.arXiv preprint arXiv:2505.04512, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05485","last_updated":"2026-08-06T00:28:38Z","snapshot_observed_at":"2026-08-09T03:10:27.328899Z","submitted_at":"2026-08-06T00:28:38Z","title":"VideoArgus: Agentic Rubric-Grounded Unified Evaluation for Video Generation and Editing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T12:16:44.665393Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2608.05485"},"observation_digest":"sha256:87f06d883e2dad6dc5f4b9f3324cc6107486fa6516151aef6b3253999c6b542d","observation_id":"f7d9a41d-ccf7-4740-93f2-eabb73556743","resolution":{"observed_at":"2026-08-08T12:16:44.665393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-08-08T04:54:58.654243Z","title":"Animate anyone 2: High-fidelity character image animation with environment affordance","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05648","last_updated":"2026-08-06T06:46:35Z","snapshot_observed_at":"2026-08-09T03:10:44.001929Z","submitted_at":"2026-08-06T06:46:35Z","title":"Vorch-IR: Long-Form Unified Multimodal Identity Replacement Video Generation","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-08T04:54:58.654243Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2608.05648"},"observation_digest":"sha256:8af5c73d524d73fbb5d98d25ebd446c505ef102371a6a18898c9021e23818f57","observation_id":"7b68b13c-0de6-45ee-807e-dc1472fd2363","resolution":{"observed_at":"2026-08-08T04:54:58.654243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.04512/citation-record","integrity":"/paper/2505.04512/integrity","json":"/paper/2505.04512/citation-record.json","paper":"/paper/2505.04512"},"outbound":[],"paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 38 inbound Pith citation observations for arXiv:2505.04512."}