{"as_of":"2026-08-10T05:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fc11c0d18bb17dad41812f879a384780720bf8e4e6e84ca786b540dcd77b91fa","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:30:33.055697Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T20:11:31.576642Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T22:56:20.169424Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"cited_work":{"arxiv_id":"2506.07848","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07848","snapshot_observed_at":"2026-07-01T22:56:20.169424Z","title":"Polyvivid: Vivid multi-subject video generation with cross-modal interaction and enhancement","venue":null,"work_id":"b4a9289e-29a2-47d9-8ce8-c72eef2327b2","year":2025},"citing_paper":{"arxiv_id":"2604.06339","last_updated":"2026-04-07T18:17:05Z","snapshot_observed_at":"2026-07-06T22:54:53.308309Z","submitted_at":"2026-04-07T18:17:05Z","title":"Evolution of Video Generative Foundations","version":1},"reference_index":206,"source":"pdf_text","source_observed_at":"2026-05-10T18:41:38.616611Z"},"links":{"cited_paper":"/paper/2506.07848","citing_paper":"/paper/2604.06339"},"observation_digest":"sha256:917901a461761e9b01e829096638e57140797ccf6dd14a57fa760b0160aac102","observation_id":"3d494d21-a065-448a-af60-769d4e10c20c","resolution":{"observed_at":"2026-05-11T00:05:51.123093Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"cited_work":{"arxiv_id":"2506.07848","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07848","snapshot_observed_at":"2026-07-01T22:56:20.169424Z","title":"Polyvivid: Vivid multi-subject video generation with cross-modal interaction and enhancement","venue":null,"work_id":"b4a9289e-29a2-47d9-8ce8-c72eef2327b2","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"cited_paper":"/paper/2506.07848","citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:d733fc8eed899d562b3d63f2787e96998f15d9787998f14291bfa8bb89a858f4","observation_id":"3d7b7d1c-4e97-49d1-9e0f-205daa78cebf","resolution":{"observed_at":"2026-05-13T02:32:06.483612Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"cited_work":{"arxiv_id":"2506.07848","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07848","snapshot_observed_at":"2026-07-01T22:56:20.169424Z","title":"Polyvivid: Vivid multi-subject video generation with cross-modal interaction and enhancement","venue":null,"work_id":"b4a9289e-29a2-47d9-8ce8-c72eef2327b2","year":2025},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"cited_paper":"/paper/2506.07848","citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:5bd91b5fbff3c500c13d353233da995c9542ff7a046afac04db2eb8d1df3de23","observation_id":"49a8ca39-c798-42c2-9a7a-58f88f3ce637","resolution":{"observed_at":"2026-07-01T22:56:20.171795Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07848","snapshot_observed_at":"2026-07-11T20:11:31.576642Z","title":"arXiv preprint arXiv:2506.07848 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04311","last_updated":"2026-07-07T14:30:21Z","snapshot_observed_at":"2026-08-04T12:36:41.280283Z","submitted_at":"2026-07-05T13:54:33Z","title":"Aura: Consistent Multi-Subject Video Generation via VLM-Grounded Semantic Alignment","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-11T20:11:31.576642Z"},"links":{"cited_paper":"/paper/2506.07848","citing_paper":"/paper/2607.04311"},"observation_digest":"sha256:2cc9786db928fcd849cad3fa14403d4e55f8fad75e847ca4d5d8fffcb1ea8d4a","observation_id":"f1f519fa-6a6d-4a2d-baa5-688f1e0aaf91","resolution":{"observed_at":"2026-07-11T20:11:31.576642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.07848/citation-record","integrity":"/paper/2506.07848/integrity","json":"/paper/2506.07848/citation-record.json","paper":"/paper/2506.07848"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T05:30:32.874829Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:32.874829Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:605a5f0a8afaa923e3b5c038649e0d288bfeef6b03304d12f7541c34775a9b99","observation_id":"c4dcf0d4-b5af-472c-bf9a-4064cd2a576f","resolution":{"observed_at":"2026-08-07T05:30:32.874829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T05:30:32.880099Z","title":"Blattmann, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:32.880099Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:0ce90642eafc41fe812e8a3a92204baccd4f4fe211960d938a9922949b38c2b5","observation_id":"65232c13-4a34-4297-b1a9-9fa062e9ebd3","resolution":{"observed_at":"2026-08-07T05:30:32.880099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:30:33.609398Z","title":"Carreira and A","venue":null,"work_id":"05a445fd-2c96-40fa-b282-ba7b26a22bdd","year":2017},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:32.884690Z"},"links":{"citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:dc0cd8ab012916a75ed4e4b02b8af2e6646fcc0f007f77ff1667885644af3291","observation_id":"26b2b07c-bdf0-48a2-a14d-bf3ccb8b3f0a","resolution":{"observed_at":"2026-08-07T05:30:33.612763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:30:33.598987Z","title":"Chefer, S","venue":null,"work_id":"77de6272-1dd8-4c33-95b5-bbb9a054706d","year":2024},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:32.888262Z"},"links":{"citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:909ada1a4b05a3642c2dc4649576501407d592bd5224c2acf669a3c0c38e411d","observation_id":"9e15de1b-3f68-4af7-9c4c-21e0d3498141","resolution":{"observed_at":"2026-08-07T05:30:33.602556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:30:33.588463Z","title":null,"venue":null,"work_id":"4e44ca05-273a-4299-85a2-35c5668233f4","year":2024},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:32.892748Z"},"links":{"citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:2a6cd789237a9c274811d7337b20297aac84c650584c51bc9c1573e4f14e7160","observation_id":"acd89131-1c62-4c1a-9edb-ce308a4e98e7","resolution":{"observed_at":"2026-08-07T05:30:33.592113Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:30:33.578178Z","title":null,"venue":null,"work_id":"c027431a-a994-4efd-82c3-b8a08a9f0aea","year":2024},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:32.896304Z"},"links":{"citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:6a564be4d74025678c6a622ff14b0351d4d90d522dd2e8f06aa26284c017b350","observation_id":"014d3878-8673-46d3-a57e-5a234eb77074","resolution":{"observed_at":"2026-08-07T05:30:33.581859Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06187","last_updated":"2025-03-20T17:59:56Z","snapshot_observed_at":"2026-07-06T20:19:26.003822Z","submitted_at":"2025-01-10T18:59:54Z","title":"Multi-subject Open-set Personalization in Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06187","snapshot_observed_at":"2026-08-07T05:30:32.900997Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:32.900997Z"},"links":{"cited_paper":"/paper/2501.06187","citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:13e2762ea05d8a47d423b22e33daf8204df1d181cefe2e9355cf82a42d1e34f5","observation_id":"e7ee9805-6d3c-4c63-8ac3-f8620a328848","resolution":{"observed_at":"2026-08-07T05:30:32.900997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:30:33.566472Z","title":null,"venue":null,"work_id":"a47d2ed0-f319-4dae-9ca0-c1bee8522ba3","year":2019},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:32.904426Z"},"links":{"citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:9ed00dd3d6ac25e0d7df98bfc733dea70fa83ac03fc87ca2adeacedbc9e6c9ce","observation_id":"5b0db90e-4a28-4768-967f-fc6571f623e4","resolution":{"observed_at":"2026-08-07T05:30:33.570754Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:30:33.555922Z","title":"Esser, S","venue":null,"work_id":"7a787c1b-eb1d-41c0-a394-a59301e23f5f","year":2024},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:32.907803Z"},"links":{"citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:d6e94bc80e3a346b5f900a7e3b9e250656971e719a11a2a9124dfcb8c99f6db7","observation_id":"9fd35efb-5bd5-4fc8-b149-aa5b49f6e6b2","resolution":{"observed_at":"2026-08-07T05:30:33.559434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-07T16:12:03.138083Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-08-07T05:30:32.911278Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:32.911278Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:7971fda39e8d26224385a0c82d2f5f34c2dd645ef809ee6584f5680e18c729b5","observation_id":"d13d751c-5cc6-4351-86f9-1e9a92164b10","resolution":{"observed_at":"2026-08-07T05:30:32.911278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-07T05:30:32.915736Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:32.915736Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:88e8208c72d664b1f01faba3636ba87ff8cc9f826c6a3be4fd6204c303244cad","observation_id":"641b8e7e-ff02-4cd9-8491-e5529d7b9da5","resolution":{"observed_at":"2026-08-07T05:30:32.915736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:30:33.544684Z","title":"Hailuo.https://hailuoai.video/, 2025","venue":null,"work_id":"57a717c1-2e78-416e-889d-be938e880c33","year":2025},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:32.919468Z"},"links":{"citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:57333b18ebdf5c85420a89a5405bc1919e9385e64e13c7e13a719452f8f955da","observation_id":"71e00960-50b1-449a-aae8-59de3dc5b93f","resolution":{"observed_at":"2026-08-07T05:30:33.549238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15275","last_updated":"2024-06-25T16:57:27Z","snapshot_observed_at":"2026-07-06T18:04:33.726854Z","submitted_at":"2024-04-23T17:59:43Z","title":"ID-Animator: Zero-Shot Identity-Preserving Human Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15275","snapshot_observed_at":"2026-08-07T05:30:32.923584Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:32.923584Z"},"links":{"cited_paper":"/paper/2404.15275","citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:1dbf5416ddb1244c89c95854870ba2a008feb3c4037dc3d8e2814c0542e1382a","observation_id":"09860b72-42ef-44ba-9626-a86e246c6e5c","resolution":{"observed_at":"2026-08-07T05:30:32.923584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:30:32.927378Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:32.927378Z"},"links":{"citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:2650a79574f2bdfc8aa1d3f241e8086bfe168a8bd47f32b243f06cbdf5be1ec8","observation_id":"51327993-868a-4a4a-8765-b91f4ff8d639","resolution":{"observed_at":"2026-08-07T05:30:32.927378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15789","last_updated":"2024-05-01T02:37:18Z","snapshot_observed_at":"2026-07-06T18:04:54.726338Z","submitted_at":"2024-04-24T10:28:54Z","title":"MotionMaster: Training-free Camera Motion Transfer For Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15789","snapshot_observed_at":"2026-08-07T05:30:32.930745Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:32.930745Z"},"links":{"cited_paper":"/paper/2404.15789","citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:ac87b7ab2c18a3b6854d6dc25bfa0747f2ca882f20bfc35a7801ba5ca04fc957","observation_id":"6ee2d3f2-0ecd-49bb-9c5e-6daf89019b76","resolution":{"observed_at":"2026-08-07T05:30:32.930745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-08-07T05:30:32.934408Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:32.934408Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:496eb85992a6280f2f0b1afc0cb57586b87f35b90ae28568a9f4445aef16677a","observation_id":"788063b8-c336-4922-8764-25d8cbfc7f70","resolution":{"observed_at":"2026-08-07T05:30:32.934408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04698","last_updated":"2025-05-13T06:42:52Z","snapshot_observed_at":"2026-08-08T15:16:50.023350Z","submitted_at":"2025-01-08T18:59:01Z","title":"ConceptMaster: Multi-Concept Video Customization on Diffusion Transformer Models Without Test-Time Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04698","snapshot_observed_at":"2026-08-07T05:30:32.938000Z","title":"Huang, Z","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:32.938000Z"},"links":{"cited_paper":"/paper/2501.04698","citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:d31b6e773f71a6e9ec930844c142695d18400d8dd965575737d91b576337a4d2","observation_id":"a2ebc5f8-5042-4246-882d-8f37098a098e","resolution":{"observed_at":"2026-08-07T05:30:32.938000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:30:32.942747Z","title":"Huang, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:32.942747Z"},"links":{"citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:65c7970daa73b77f1b0231fa59f5ebed8db197d901d401e3f10630c2d62fd308","observation_id":"540271da-c943-4812-9335-e520231aefe1","resolution":{"observed_at":"2026-08-07T05:30:32.942747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:30:33.521953Z","title":"Jiang, T","venue":null,"work_id":"9d6dc7a2-38fc-4418-a659-7b213b732c48","year":2024},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:32.946940Z"},"links":{"citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:0a780d9831c5c86370706c4b5352fa3c50204794692ce20a043f236a6b163151","observation_id":"52ecb108-716a-4ba1-91b0-b5532fb7517b","resolution":{"observed_at":"2026-08-07T05:30:33.525452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07598","last_updated":"2025-03-11T06:44:25Z","snapshot_observed_at":"2026-07-06T20:50:05.070886Z","submitted_at":"2025-03-10T17:57:04Z","title":"VACE: All-in-One Video Creation and Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07598","snapshot_observed_at":"2026-08-07T05:30:32.950352Z","title":"Jiang, Z","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:32.950352Z"},"links":{"cited_paper":"/paper/2503.07598","citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:85d35fae460f773dba689406006a42f17e4996dba49690f86f0ed5047bb82fcc","observation_id":"adf7c961-802f-4aa7-b3aa-19e0f32162d4","resolution":{"observed_at":"2026-08-07T05:30:32.950352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:30:33.511548Z","title":"Keling.https://klingai.com/cn/, 2025","venue":null,"work_id":"40bc74b7-a7b9-4512-b6a1-b5d553f2a76e","year":2025},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:32.953610Z"},"links":{"citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:87739d5ab8183905e2e0cbfb1ef8178c3989828464afe1529d95abcbe9a4dfee","observation_id":"f88c9a3f-7b87-4f0e-b7b8-ba0fa0638e13","resolution":{"observed_at":"2026-08-07T05:30:33.515383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17725","last_updated":"2024-10-23T09:55:22Z","snapshot_observed_at":"2026-07-06T19:38:22.461739Z","submitted_at":"2024-10-23T09:55:22Z","title":"YOLOv11: An Overview of the Key Architectural Enhancements","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17725","snapshot_observed_at":"2026-08-07T05:30:32.956666Z","title":"Khanam and M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:32.956666Z"},"links":{"cited_paper":"/paper/2410.17725","citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:b621a62c42c912b1a9aff5c65f326022ac865e757687ec4322915015a799c580","observation_id":"7c5a358e-d494-44a7-bdc6-fdf727b93f40","resolution":{"observed_at":"2026-08-07T05:30:32.956666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-07T05:30:32.960064Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:32.960064Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:8fcfd631bf23560f25605d1cf074a6f6bb26e71f9d99d117ed0ca89df1cb6211","observation_id":"852fb42d-a9c3-4703-b06c-181505fcf0b5","resolution":{"observed_at":"2026-08-07T05:30:32.960064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:30:33.501837Z","title":null,"venue":null,"work_id":"e1a7d98d-d059-4a7d-bb09-336fa1cb6d94","year":2024},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:32.963301Z"},"links":{"citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:02ec845f3780869c26901bf87211c33eeb39130877771e8d003e4295a02ec1b3","observation_id":"b117c48f-1a0b-4a48-bd43-d0cf9555ecd3","resolution":{"observed_at":"2026-08-07T05:30:33.505384Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01801","last_updated":"2025-06-02T15:42:06Z","snapshot_observed_at":"2026-08-08T20:24:18.281655Z","submitted_at":"2025-06-02T15:42:06Z","title":"OmniV2V: Versatile Video Generation and Editing via Dynamic Content Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01801","snapshot_observed_at":"2026-08-07T05:30:32.966807Z","title":"Liang, Z","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:32.966807Z"},"links":{"cited_paper":"/paper/2506.01801","citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:3da8fecbcf9434f93e7ab460fba7b8a432ae7dcf476ec881016965e71593c7bc","observation_id":"20c8f669-c750-4943-8128-6c68e642efac","resolution":{"observed_at":"2026-08-07T05:30:32.966807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:30:32.970705Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:32.970705Z"},"links":{"citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:2f5e36312aeb0bd1f705fe60ce82d7bf856dd4839c2c807c9bcf408d647ca8a3","observation_id":"7ad2a0c6-d9a0-4088-b3d5-d113549528fa","resolution":{"observed_at":"2026-08-07T05:30:32.970705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-07T05:30:32.974027Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:32.974027Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:df40bb4214174f1fe3d8b745999a3da90acdf05b7bedfc499586401e860d88db","observation_id":"e62295d4-8fa2-4396-8deb-fac1b7d52bf6","resolution":{"observed_at":"2026-08-07T05:30:32.974027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:30:33.486196Z","title":null,"venue":null,"work_id":"038f000f-4ac4-4514-93df-7fda8df3b4ee","year":2024},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:32.978124Z"},"links":{"citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:7eca3d02a2e43d5dfaa401bcea6454ff16f6590e4c8e77be673797610157b593","observation_id":"98a3f92e-9485-4ece-8bf1-d5fcfb7d2279","resolution":{"observed_at":"2026-08-07T05:30:33.489553Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17177","snapshot_observed_at":"2026-08-07T05:30:32.981781Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:32.981781Z"},"links":{"cited_paper":"/paper/2402.17177","citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:6d5df60ba0a7f776121df1654721d97d8baeeaa305d86566edcc9a0955b299ca","observation_id":"da3df5d8-0e4d-47c9-b56b-87c5fdc313fc","resolution":{"observed_at":"2026-08-07T05:30:32.981781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-09T18:02:17.307812Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-07T05:30:32.985757Z","title":"Oquab, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:32.985757Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:36954346f91889a0d4d60ae2205daf653d5ba8dcb9afc01472c4f5602d1b8535","observation_id":"9a65e3a7-a8e5-431d-b192-dfaedde6aae6","resolution":{"observed_at":"2026-08-07T05:30:32.985757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:30:32.989540Z","title":"Peebles and S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:32.989540Z"},"links":{"citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:e34a905948b8a050216fadf76886d3b37e40ed3c3bae890ff9a780131e4d74ba","observation_id":"20e6f371-1ccb-40d5-bbc1-4607a7dcaf99","resolution":{"observed_at":"2026-08-07T05:30:32.989540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:30:32.994167Z","title":"Pika.https://pika.art/, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:32.994167Z"},"links":{"citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:0daa1d3f81b0a9bdd553d5e345a44adf4e7f0f38ad2c3d0f263ee6e9dfd14cd8","observation_id":"eba37099-d398-4880-b291-d32f32d5b804","resolution":{"observed_at":"2026-08-07T05:30:32.994167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-07T05:30:32.997934Z","title":"Polyak, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:32.997934Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:f41a3efdda60c94d2c868206b2872f2b840cd129b9dfe5edeac5be5fdee9198f","observation_id":"fe2140d3-0410-4633-b890-35f32edab8e9","resolution":{"observed_at":"2026-08-07T05:30:32.997934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:30:33.001566Z","title":"Radford, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:33.001566Z"},"links":{"citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:bdc1d4cef6f50a4d0268b51d74dac6f1dbdd21faffb6346d8cbe2f52eefcdd4c","observation_id":"1193e3a8-e1ee-497a-bbb3-d7bfede70c0f","resolution":{"observed_at":"2026-08-07T05:30:33.001566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-07T05:30:33.004775Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:33.004775Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:c052bd9f08dcefdaef5b18ad40a100c19082e6f0415e9e3345c788fff4cd0be5","observation_id":"d58ba38d-d620-4cb4-b579-57496e270ca5","resolution":{"observed_at":"2026-08-07T05:30:33.004775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:30:33.008178Z","title":"Rombach, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:33.008178Z"},"links":{"citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:ff4d5551ed394b7d03da82c6bfc609e24d7a5b276ae17c1cd9994eafe82af4eb","observation_id":"6bd4dd8c-3ca5-418b-9e70-6d987e5a7d91","resolution":{"observed_at":"2026-08-07T05:30:33.008178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:30:33.451648Z","title":null,"venue":null,"work_id":"28c44984-0f03-4359-bda8-b72fd92fdd39","year":2023},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:33.012354Z"},"links":{"citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:37d17414ed4af26bdf8b76ff6da7e4d7dd8aeeeb6479f78940a9f4c31b72cae5","observation_id":"22903861-99de-4589-9c12-032ff825573f","resolution":{"observed_at":"2026-08-07T05:30:33.456056Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15098","last_updated":"2025-07-07T17:33:23Z","snapshot_observed_at":"2026-08-09T00:44:58.573039Z","submitted_at":"2024-11-22T17:55:15Z","title":"OminiControl: Minimal and Universal Control for Diffusion Transformer","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15098","snapshot_observed_at":"2026-08-07T05:30:33.016398Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:33.016398Z"},"links":{"cited_paper":"/paper/2411.15098","citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:8949bd8eb5c30c9be17899f67f4c4de57d8903c0f4b7331d012a5a6c952c6767","observation_id":"2170f9ea-fbf8-402f-9956-73cff330ae2a","resolution":{"observed_at":"2026-08-07T05:30:33.016398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:30:33.441209Z","title":"Vidu.https://www.vidu.cn/, 2025","venue":null,"work_id":"1c3671ed-36c5-4e39-8461-aca3c97a0b58","year":2025},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:33.020971Z"},"links":{"citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:b843e9a2f3ead3496c6ecf2837abeacbf50dc80beabdbe7c0e4ac0a504fc3aed","observation_id":"8ab8caa8-94fe-4a1f-bd69-fe8ea910bf47","resolution":{"observed_at":"2026-08-07T05:30:33.444854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-07T05:30:33.024592Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:33.024592Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:4a5e6c3f7244ea5d319ec2551c32337bf462a666c9e0f264b4a1fa7cccfb8af2","observation_id":"aaa5cc40-d3d4-4670-90f3-c313426ea273","resolution":{"observed_at":"2026-08-07T05:30:33.024592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08260","last_updated":"2025-04-26T17:58:24Z","snapshot_observed_at":"2026-08-01T11:16:30.883699Z","submitted_at":"2024-10-10T17:57:49Z","title":"Koala-36M: A Large-scale Video Dataset Improving Consistency between Fine-grained Conditions and Video Content","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08260","snapshot_observed_at":"2026-08-07T05:30:33.029140Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:33.029140Z"},"links":{"cited_paper":"/paper/2410.08260","citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:a5063a1fb30ed729f4b286d374aca67f81fa5d4e287d31ee7b7fc6e8cf5e9cf5","observation_id":"b968ddfb-b492-40fb-9464-ff3a9d280d70","resolution":{"observed_at":"2026-08-07T05:30:33.029140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:30:33.033126Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:33.033126Z"},"links":{"citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:e26a09bfd87b55921268593f4dad4809cfff8516c56f5df40f2df8ffc428fdd9","observation_id":"05864c36-0f1c-4b0e-8657-9709df16deae","resolution":{"observed_at":"2026-08-07T05:30:33.033126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:30:33.430954Z","title":null,"venue":null,"work_id":"20bd6b99-b38d-4b7c-8df5-0688c7015484","year":2025},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:33.037361Z"},"links":{"citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:160b31f6fd82799b951b9305aeed6c38c14957cf0df6be2bde98810e0c034f9b","observation_id":"71b94bfd-edf0-4df3-b9c6-891b5e00de7a","resolution":{"observed_at":"2026-08-07T05:30:33.434457Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:30:33.419071Z","title":null,"venue":null,"work_id":"dc5c47c9-cc3a-49f8-a269-2ad5bbfcf176","year":2024},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:33.041175Z"},"links":{"citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:fe1610931dd5b78a382719c9be5fc8af94426bcfeb1b5c940f4e85007a6d52e8","observation_id":"09a7381a-dea6-4daf-adfb-680a20eb4248","resolution":{"observed_at":"2026-08-07T05:30:33.423512Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-07T05:30:33.044724Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:33.044724Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:e2d4399d4a7617a47ae1ef7daccf7b26f3dfe2ccf8a818f63f38fe4df42493e6","observation_id":"f8307a88-ae46-4052-bf27-b46c3ef04f15","resolution":{"observed_at":"2026-08-07T05:30:33.044724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-07T05:30:33.048874Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:33.048874Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:edda08e59c1fd1a8d9ccb5cd10146fc139d001f3781326510ea63ac517f616e5","observation_id":"97b49b59-a33d-416b-bff2-fb5d884efcde","resolution":{"observed_at":"2026-08-07T05:30:33.048874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17440","last_updated":"2025-03-25T23:08:48Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T13:58:24Z","title":"Identity-Preserving Text-to-Video Generation by Frequency Decomposition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17440","snapshot_observed_at":"2026-08-07T05:30:33.052194Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:33.052194Z"},"links":{"cited_paper":"/paper/2411.17440","citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:1888004c9bfd4549672cb8bd0426540fb027bde310b5cc869fde5791e40533e9","observation_id":"c3761732-b039-47c0-a26f-1e59f3b149d6","resolution":{"observed_at":"2026-08-07T05:30:33.052194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15458","last_updated":"2024-10-20T17:51:35Z","snapshot_observed_at":"2026-08-09T19:18:25.696349Z","submitted_at":"2024-10-20T17:51:35Z","title":"Allegro: Open the Black Box of Commercial-Level Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15458","snapshot_observed_at":"2026-08-07T05:30:33.055697Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:33.055697Z"},"links":{"cited_paper":"/paper/2410.15458","citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:277cd4889b1ab5b69519f90cba0606fdb6e856933562dc978fd75fe14b82d307","observation_id":"ef30a557-886f-49d0-8ac8-70202a503d7d","resolution":{"observed_at":"2026-08-07T05:30:33.055697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 4 inbound Pith citation observations for arXiv:2506.07848."}