{"as_of":"2026-08-09T07:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a0437ced2cfaef9fabe28a65fff46be206d91b2df0ddbee80fef8e265d5d2274","coverage":[{"denominator":83,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":83,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T08:45:56.546648Z","state":"measured"},{"denominator":83,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":83,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.21027/citation-record","integrity":"/paper/2607.21027/integrity","json":"/paper/2607.21027/citation-record.json","paper":"/paper/2607.21027"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:47.849989Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:47.849989Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:a6619972f5ada4a98d69a739d7ecb8fff29e6f5acabdc1f831d2faf1e3f081b8","observation_id":"04979821-5378-4331-b7cf-13139b70f22a","resolution":{"observed_at":"2026-08-01T08:45:47.849989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-01T08:45:47.939453Z","title":"An image is worth one word: Per- sonalizing text-to-image generation using textual inversion, 2022, arXiv preprint arXiv:2208.01618","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:47.939453Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:95b2324a2f812fd95dd46196721ce4306e993e8af342941e8a5342fe77ce9540","observation_id":"dde5b637-a5a7-4d63-8eb3-682a9d00f610","resolution":{"observed_at":"2026-08-01T08:45:47.939453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:48.039742Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:48.039742Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:c72c452be92076b0a48272feb479d182ea57075f32e860d6cb2dca36a3916230","observation_id":"52ff2417-9cd0-4b06-9177-b408efce37e3","resolution":{"observed_at":"2026-08-01T08:45:48.039742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15275","last_updated":"2024-06-25T16:57:27Z","snapshot_observed_at":"2026-07-06T18:04:33.726854Z","submitted_at":"2024-04-23T17:59:43Z","title":"ID-Animator: Zero-Shot Identity-Preserving Human Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15275","snapshot_observed_at":"2026-08-01T08:45:48.164156Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:48.164156Z"},"links":{"cited_paper":"/paper/2404.15275","citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:56d2ba93b4b37958ba3a22a8526233b229b92ec2bac5fc484a692519c1adec9c","observation_id":"8b06610e-e8fc-4373-8eca-63b02eb97a07","resolution":{"observed_at":"2026-08-01T08:45:48.164156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13452","last_updated":"2025-02-27T06:55:41Z","snapshot_observed_at":"2026-07-06T20:24:50.262766Z","submitted_at":"2025-01-23T08:06:11Z","title":"EchoVideo: Identity-Preserving Human Video Generation by Multimodal Feature Fusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13452","snapshot_observed_at":"2026-08-01T08:45:48.274281Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:48.274281Z"},"links":{"cited_paper":"/paper/2501.13452","citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:514161e18e0004d3c98b17cd0f050fa23546b799b0ce2d8129ad0d49e365e220","observation_id":"1da02510-44b9-4241-a697-8be32731aab8","resolution":{"observed_at":"2026-08-01T08:45:48.274281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:48.340361Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:48.340361Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:9ad40a439e3f2068cc96adf52932c1101d114cd6abc0428862ca3cbe77bc4556","observation_id":"879256db-3409-48ed-9da5-af0ab32ada93","resolution":{"observed_at":"2026-08-01T08:45:48.340361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01790","last_updated":"2025-03-18T10:47:27Z","snapshot_observed_at":"2026-07-06T20:16:09.014564Z","submitted_at":"2025-01-03T12:45:22Z","title":"Ingredients: Blending Custom Photos with Video Diffusion Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01790","snapshot_observed_at":"2026-08-01T08:45:48.400345Z","title":"Ingredients: Blending Custom Photos with Video Diffusion Transformers, 2025, arXiv preprint arXiv:2501.01790","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:48.400345Z"},"links":{"cited_paper":"/paper/2501.01790","citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:fe362de239c438babef290792027f8e254c15efc29dce05bc9d34a5a618f1da6","observation_id":"8ddf9296-090a-4599-bc4f-54f614f9b393","resolution":{"observed_at":"2026-08-01T08:45:48.400345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:48.486586Z","title":"Peebles and S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:48.486586Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:79ee892e1e9c42297af6c6afeae5d399e13275ff690ed58bab129737faf5b83f","observation_id":"3302ffb3-3434-41a4-8921-7fe0f811fdaf","resolution":{"observed_at":"2026-08-01T08:45:48.486586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:48.573792Z","title":"Generative adversarial networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:48.573792Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:3b2591aad4f44dd900c1afc3fb82b3642e978925ee184ade166a66d11ed08e56","observation_id":"a1526efe-a4c7-4a29-b777-6ff343080701","resolution":{"observed_at":"2026-08-01T08:45:48.573792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:48.636063Z","title":"Karras, S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:48.636063Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:2eddac51cfabcbb75d4b5182bb190c8fac2358cd17bb5bca4f5de47effbeb4db","observation_id":"3eef3856-9cad-442b-8d17-6a90ef3e7dee","resolution":{"observed_at":"2026-08-01T08:45:48.636063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:48.721612Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:48.721612Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:a1022d8323fef7c07b59edb5818d2d945d3a206c8651ad635ef4cc0426b7d53d","observation_id":"44b772a2-7647-48eb-b168-a940d5d48f2e","resolution":{"observed_at":"2026-08-01T08:45:48.721612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:48.807772Z","title":"K ¨oksal, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:48.807772Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:130aeafe08ec83313fe0e5237af51993c21b4479f562d7e461314bc109271d20","observation_id":"b7fc6a97-fa8e-461c-99b6-7a3560d986ef","resolution":{"observed_at":"2026-08-01T08:45:48.807772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:48.900449Z","title":"Taming transformers for high- resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:48.900449Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:7b302944961f9af8cb9ca5c6abbcf0dd852730883863b4ff09d3405cfe2b39ba","observation_id":"41c282ae-151f-450d-9534-5bd66bca3731","resolution":{"observed_at":"2026-08-01T08:45:48.900449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-01T08:45:48.961920Z","title":"Y .; Luong, T.; Baid, G.; Wang, Z.; Vasude- van, V .; Ku, A.; Yang, Y .; Ayan, B","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:48.961920Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:ab4ab806ff7ec435f2a069c6f839f115ac75f398168a46b4579543074c44f3fd","observation_id":"f01819d9-7891-4554-8b92-a003e39b4b78","resolution":{"observed_at":"2026-08-01T08:45:48.961920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:49.051032Z","title":"Rombach, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:49.051032Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:b61540818b4f45a399b96f8412d5d860b20948af0867f85e4cc549f5ac8dd98c","observation_id":"e4b3e649-1a7f-4ef7-b35d-16343ed9a549","resolution":{"observed_at":"2026-08-01T08:45:49.051032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:49.142905Z","title":"L.; Ghasemipour, K.; Gontijo Lopes, R.; Karagol Ayan, B.; Salimans, T.; et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:49.142905Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:2dfc1830ebe235e64e116e4a5bffc0dd9648975fb3763942a462ef88975ff348","observation_id":"e4cc1a4d-e696-4dc2-a9c3-0de8f436ec98","resolution":{"observed_at":"2026-08-01T08:45:49.142905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-01T08:45:49.235738Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis, 2023, arXiv preprint arXiv:2307.01952","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:49.235738Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:d3718d740deb9e670b5eaa33780bd31947a29151d7dbcac2b3803131292d44a6","observation_id":"8c975695-e6fb-4676-b5d3-3eb7b97980c3","resolution":{"observed_at":"2026-08-01T08:45:49.235738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:49.318127Z","title":"Unialignment: Semantic alignment for unified image generation, understanding, manipulation and perception","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:49.318127Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:cd1574b09a287cd0ca65f025c39da97e5ab69da7897e17d2e30b2897f41137bf","observation_id":"9cea2026-2787-4f02-9c29-187d50d1322a","resolution":{"observed_at":"2026-08-01T08:45:49.318127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:49.409780Z","title":"3SGen: Unified Subject, Style, and Structure-Driven Image Generation with Adaptive Task-specific Memory, 2025, arXiv preprint arXiv:2512.19271","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:49.409780Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:5530a7de319fb0d7ee29944f709153e9746bf03990641673f7519b92e95ccbb6","observation_id":"f585b9ff-f8e4-47ff-8fbd-d1299f8f12e7","resolution":{"observed_at":"2026-08-01T08:45:49.409780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:49.496661Z","title":"Fine-Grained Text-to-Image Synthesis with Semantic Refinement","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:49.496661Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:4b1e7485413d1c891ccb1a1e1768d7294946d24a6a2655385428b9fafdaee9b4","observation_id":"51798d8f-8776-43b8-8ee3-a4225cc2c005","resolution":{"observed_at":"2026-08-01T08:45:49.496661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:49.584438Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:49.584438Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:5cf7c545b752f142eec553b3fafb5a21f77b662c0fcdd8fc419c25abc08ad2ca","observation_id":"0e4e8d98-ae7c-4924-8477-eb7e2d9bcc00","resolution":{"observed_at":"2026-08-01T08:45:49.584438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:49.664719Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:49.664719Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:e4b51ee30a3b395e54f925a46f2893426f9923f10ac6891b37ea6c9d6433cd57","observation_id":"6b12dabc-3e86-4776-971c-d1e79deffa23","resolution":{"observed_at":"2026-08-01T08:45:49.664719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:49.755672Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:49.755672Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:6871a1bb7cec98b7c5c52ae291f6e3780a690c7d1d8ef4ac4a571ed4986d7647","observation_id":"a793c566-9794-46f4-bcc3-b3b1f0fe9f64","resolution":{"observed_at":"2026-08-01T08:45:49.755672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-02T13:01:06.918463Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-08-01T08:45:49.844026Z","title":"Latte: Latent diffusion transformer for video generation, 2024, arXiv preprint arXiv:2401.03048","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:49.844026Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:7bff159300185847d29865982cad562b7e53c205bc016a629ed6bc489703106a","observation_id":"b5965f3f-70a2-4187-b623-eed03b805114","resolution":{"observed_at":"2026-08-01T08:45:49.844026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00131","snapshot_observed_at":"2026-08-01T08:45:49.939631Z","title":"Open-sora plan: Open-source large video generation model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:49.939631Z"},"links":{"cited_paper":"/paper/2412.00131","citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:d982e4379ab2355fd9387243ccf50ff4a5eca6759d122a8837bc972b5101b134","observation_id":"21201fe6-024b-481b-ac1b-ce2d3c57562e","resolution":{"observed_at":"2026-08-01T08:45:49.939631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20404","snapshot_observed_at":"2026-08-01T08:45:50.028879Z","title":"Open-sora: Democratizing efficient video production for all","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:50.028879Z"},"links":{"cited_paper":"/paper/2412.20404","citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:36d189f27d487f5275a6b5f7f1e2ccda005645b075e1081dc183ce76dcafbe23","observation_id":"f4477a6b-15ab-41a0-b874-d7c967e631e1","resolution":{"observed_at":"2026-08-01T08:45:50.028879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-01T08:45:50.148925Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer, 2024, arXiv preprint arXiv:2408.06072","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:50.148925Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:8b31050ac61efe6fce3bab3313b9678b8d02a1972bac9042c5229095103469ea","observation_id":"a86cc048-0fde-4905-978f-df6072d88e4f","resolution":{"observed_at":"2026-08-01T08:45:50.148925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-01T08:45:50.326139Z","title":"Hunyuanvideo: A systematic framework for large video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:50.326139Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:aefa51b450a3eb55ac76461d7bfcde5f842ae2b1b8284c7e33fe6381db654435","observation_id":"41685536-516c-413a-ae04-3a1e07d9f2a3","resolution":{"observed_at":"2026-08-01T08:45:50.326139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05422","last_updated":"2025-08-15T08:56:27Z","snapshot_observed_at":"2026-08-07T15:48:42.775075Z","submitted_at":"2025-05-08T17:12:19Z","title":"TokLIP: Marry Visual Tokens to CLIP for Multimodal Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05422","snapshot_observed_at":"2026-08-01T08:45:50.500497Z","title":"Toklip: Marry visual tokens to clip for multimodal comprehension and generation, 2026, arXiv preprint arXiv:2505.05422","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:50.500497Z"},"links":{"cited_paper":"/paper/2505.05422","citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:11ac63031feb0a6d1b8ee9b8cd9d147957c64e3c1fd49b1a34b34adf5b0a4877","observation_id":"4601cdfb-62c4-4bba-a418-da37901b710f","resolution":{"observed_at":"2026-08-01T08:45:50.500497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.24849","last_updated":"2026-06-23T17:28:00Z","snapshot_observed_at":"2026-08-03T11:30:36.402988Z","submitted_at":"2026-06-23T17:28:00Z","title":"IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.24849","snapshot_observed_at":"2026-08-01T08:45:50.621647Z","title":"IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation, 2026, arXiv preprint arXiv:2606.24849","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:50.621647Z"},"links":{"cited_paper":"/paper/2606.24849","citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:1f9e6009f432b281528c59048fdf34edb66d0f8c9b864d89cce6bc9e247d6373","observation_id":"be5a43f0-8ed9-4f93-b84c-0ea0d2e072ef","resolution":{"observed_at":"2026-08-01T08:45:50.621647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:50.787703Z","title":"Concept-Guided Tokenization: Closing the Gap Between Reconstruction and Generation, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:50.787703Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:9b2ff1c140e0102db55ffae676820220ab5ce3f8c906eb47f418b09d1cf6e9fa","observation_id":"6c21d9fe-24ea-4e25-9686-17b3e41d81fa","resolution":{"observed_at":"2026-08-01T08:45:50.787703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12526","last_updated":"2025-05-27T04:43:05Z","snapshot_observed_at":"2026-07-06T19:34:32.629776Z","submitted_at":"2024-10-16T13:03:15Z","title":"Shaping a Stabilized Video by Mitigating Unintended Changes for Concept-Augmented Video Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12526","snapshot_observed_at":"2026-08-01T08:45:50.904043Z","title":"Shaping a Stabilized Video by Mitigating Unintended Changes for Concept-Augmented Video Editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:50.904043Z"},"links":{"cited_paper":"/paper/2410.12526","citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:8ee9d602f244b2eda3079020fc4dd13d1bd8ca6f224394dfc3206d3699bdb65c","observation_id":"fffe54f4-e2f7-4a6d-864d-de6d7ca1df70","resolution":{"observed_at":"2026-08-01T08:45:50.904043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:51.023640Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:51.023640Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:cd75a9976a7894965ba6a4144e8eb65449a534617eb470cfcfe2c21d89a85ed2","observation_id":"3b3fbf76-5f74-44de-a6af-511c5700fc85","resolution":{"observed_at":"2026-08-01T08:45:51.023640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-01T08:45:51.195504Z","title":"J.; Shen, Y .; Wallis, P.; Allen-Zhu, Z.; Li, Y .; Wang, S.; Wang, L.; and Chen, W","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:51.195504Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:643b0d3c33d97ee122de88c74504a4e979edd1191b113df63314aa1c91aab8a5","observation_id":"abcee6ac-ee23-4347-8b50-5636d92a92a7","resolution":{"observed_at":"2026-08-01T08:45:51.195504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:51.321655Z","title":"Zhang, T","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:51.321655Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:6d0fd3f9205e0281f4249083b58f19bbb928f585b37bf7b966e8f9841a546ec4","observation_id":"51697e3a-1efa-4a92-b605-d00230f453c9","resolution":{"observed_at":"2026-08-01T08:45:51.321655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:51.449963Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:51.449963Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:c9309898ccad900a317dcb98edcc14007651477c848c04d9ffc6e1d2b5695287","observation_id":"4a915594-91db-4e6e-8dd0-c7e2e7f2adfd","resolution":{"observed_at":"2026-08-01T08:45:51.449963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07519","last_updated":"2024-02-02T16:15:22Z","snapshot_observed_at":"2026-08-06T23:08:20.817133Z","submitted_at":"2024-01-15T07:50:18Z","title":"InstantID: Zero-shot Identity-Preserving Generation in Seconds","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07519","snapshot_observed_at":"2026-08-01T08:45:51.599832Z","title":"Instantid: Zero-shot identity-preserving generation in seconds","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:51.599832Z"},"links":{"cited_paper":"/paper/2401.07519","citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:8b4daf77b165bcf7ff3d3983d838bead20cec07f5262c65167b99fb0e6aff45f","observation_id":"33a1c856-56d2-479f-a4dc-9b817171a0bc","resolution":{"observed_at":"2026-08-01T08:45:51.599832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-01T08:45:51.690564Z","title":"Ip-adapter: Text compatible image prompt adapter for text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:51.690564Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:7e66f28cd299dc5725d3e679bdaed274ea29795b32e7e30e5d28ecca7ae0a131","observation_id":"68941400-d86c-445c-957a-a5bf51b6365a","resolution":{"observed_at":"2026-08-01T08:45:51.690564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16022","last_updated":"2024-10-31T12:17:39Z","snapshot_observed_at":"2026-07-06T18:05:07.494681Z","submitted_at":"2024-04-24T17:55:33Z","title":"PuLID: Pure and Lightning ID Customization via Contrastive Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16022","snapshot_observed_at":"2026-08-01T08:45:51.815191Z","title":"PuLID: Pure and Lightning ID Customization via Contrastive Alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:51.815191Z"},"links":{"cited_paper":"/paper/2404.16022","citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:8a90d15c1fd67853610718594c7b4f220ac0a0445c74eff4f36665f776b7f838","observation_id":"84972062-0a74-46ce-8da5-5d235bd1b3d1","resolution":{"observed_at":"2026-08-01T08:45:51.815191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:51.894743Z","title":"Blip-diffusion: Pre-trained subject represen- tation for controllable text-to-image generation and editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:51.894743Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:da851f89b0580aedf599a9adc9a9c432db4362da085b6c61575d4444ef488e62","observation_id":"bb98f02e-7e56-4e1a-99c9-443d1b355f8f","resolution":{"observed_at":"2026-08-01T08:45:51.894743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:51.984244Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:51.984244Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:7dbc9ea63a9a60cb6de9cd65ad23c5d532934a5ec3661d7b931e08c99c4190ef","observation_id":"55f2d88f-c001-4102-afb0-77c31c4a3512","resolution":{"observed_at":"2026-08-01T08:45:51.984244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:52.070503Z","title":"Dreamidentity: Enhanced editability for efficient face-identity preserved image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:52.070503Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:fd273698a07a5a5f2571f772c3e86fd5104efaa3c1679415239bcc5ae5426016","observation_id":"a0dfd4fd-405f-4f8e-9b2b-2aa1266af31c","resolution":{"observed_at":"2026-08-01T08:45:52.070503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:52.134146Z","title":"H.; Chechik, G.; and Cohen- Or, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:52.134146Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:881f0d152482952e2cbeb282dbb885e2bad9d0e3a82a549448ea84a64bf32d35","observation_id":"bc93d4e3-6330-4613-a818-f1cc88b5bbcc","resolution":{"observed_at":"2026-08-01T08:45:52.134146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:52.223745Z","title":"X-portrait: Expressive portrait animation with hierarchical motion attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:52.223745Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:18c7749b3400a774ebde01d24642cf8ecb0ccdcf7e746450b139376328d38266","observation_id":"b3f4765c-914b-43e8-952f-ebd0c5f221dc","resolution":{"observed_at":"2026-08-01T08:45:52.223745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:52.324072Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:52.324072Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:6840760609c6ea6e61b02278e1b9e92b1a9d824cdd407c1c6d53bb4685257ff2","observation_id":"688ab11b-1772-4358-9b41-dc34424caa9f","resolution":{"observed_at":"2026-08-01T08:45:52.324072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:52.409992Z","title":"PoseGen: In-Context LoRA Finetuning for Pose-Controllable Long Human Video Generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:52.409992Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:9f017e3e38eb11a77880fe93671115f534cfd18d7ce5e7e9d8d1ddd8100be39b","observation_id":"f5380f45-5080-41d0-b506-697fd6fa03d2","resolution":{"observed_at":"2026-08-01T08:45:52.409992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-01T08:45:52.490771Z","title":"Animatediff: Animate your personalized text- to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:52.490771Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:6371a66b4f9b5d6226e27f3f64f2a80b4dce02b18ad88b5fee9afe4042f14cd0","observation_id":"6e99865e-3d8d-4c27-badb-daddaa3011ae","resolution":{"observed_at":"2026-08-01T08:45:52.490771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04145","last_updated":"2023-11-07T17:16:06Z","snapshot_observed_at":"2026-08-02T12:25:34.488259Z","submitted_at":"2023-11-07T17:16:06Z","title":"I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04145","snapshot_observed_at":"2026-08-01T08:45:52.604815Z","title":"I2vgen-xl: High-quality image-to-video synthesis via cascaded diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:52.604815Z"},"links":{"cited_paper":"/paper/2311.04145","citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:2b018691719c2924ef53946f355115caeb118ca4fb91111d1aafe2bacd2b5303","observation_id":"53d9f9ea-7673-48ff-ad73-4811b39ac0cc","resolution":{"observed_at":"2026-08-01T08:45:52.604815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:52.768788Z","title":"Dynamicrafter: Animating open-domain images with video diffusion priors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:52.768788Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:33d5fa7e0c1ea8001cc16a4946fba7fa99f0999da4095843c31051bf774f21ec","observation_id":"b59748e8-59e6-48e1-af7a-4b698411acaa","resolution":{"observed_at":"2026-08-01T08:45:52.768788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09368","last_updated":"2024-03-20T17:36:35Z","snapshot_observed_at":"2026-07-06T17:30:08.206972Z","submitted_at":"2024-02-14T18:13:51Z","title":"Magic-Me: Identity-Specific Video Customized Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09368","snapshot_observed_at":"2026-08-01T08:45:52.867257Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:52.867257Z"},"links":{"cited_paper":"/paper/2402.09368","citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:f78f877d1c2baee13bb4b841e3a7e3707061b2386112683bd14c94bddbfe0564","observation_id":"5ab24a74-92fa-4fcd-b1c4-98f73a03c691","resolution":{"observed_at":"2026-08-01T08:45:52.867257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:52.951559Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:52.951559Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:8e371143f5c990fb27f42215e106966c61bd5b7ba3f39ae905f25dd6736dd0f6","observation_id":"50a4f281-3658-4746-8cb1-ab31f5f95573","resolution":{"observed_at":"2026-08-01T08:45:52.951559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:53.102394Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:53.102394Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:40f9dccdde8f764ba28a01f27e7d1487da9f63c5735353e9239c981a07865a4b","observation_id":"a50c2573-385d-4397-81d8-52e243695af6","resolution":{"observed_at":"2026-08-01T08:45:53.102394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:53.192894Z","title":"Jiang et al., ”VideoBooth: Diffusion-based Video Generation with Image Prompts,” 2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), Seattle, W A, USA, pp","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:53.192894Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:093efe5facfdb9d00805390108acfed0b85a4dacd2e2c2b7c064a82e63d81cd1","observation_id":"94e0d4ef-e82d-44c7-93e2-a57112bba0f3","resolution":{"observed_at":"2026-08-01T08:45:53.192894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:53.296362Z","title":"Multi- concept customization of text-to-image diffusion","venue":null,"work_id":null,"year":1931},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:53.296362Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:61532c4c51d25729e371d8afa05de0e76ea9f8365c61e2e4602489c0b0ba7f34","observation_id":"61130903-dadb-44e7-8806-5df1efc8ae0f","resolution":{"observed_at":"2026-08-01T08:45:53.296362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:53.442151Z","title":"Cones 2: Customizable image synthesis with multiple subjects","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:53.442151Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:100db9c96c00fd05b4884c1ee7c245b0106e8b1ee1a06f653c01078982a4a3a1","observation_id":"50a5ab12-0aaa-403d-bbe6-a3c9a066e022","resolution":{"observed_at":"2026-08-01T08:45:53.442151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:53.551537Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:53.551537Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:c5dac150ffd9851935d19aa7dc968f09b2551a8a6a5533ceddff8aaaf77db725","observation_id":"9e718114-07ac-4539-a70b-c6a1291695b0","resolution":{"observed_at":"2026-08-01T08:45:53.551537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:53.668440Z","title":"Jiang, Q","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:53.668440Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:1bc582afe2693241c69a167e226db09c7f0dc33be3431cf0c416b1a31f4c2fde","observation_id":"0ae6c2b2-d320-4abc-aac2-7e701455f22c","resolution":{"observed_at":"2026-08-01T08:45:53.668440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19427","last_updated":"2024-04-30T10:16:21Z","snapshot_observed_at":"2026-07-06T18:07:34.924208Z","submitted_at":"2024-04-30T10:16:21Z","title":"InstantFamily: Masked Attention for Zero-shot Multi-ID Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19427","snapshot_observed_at":"2026-08-01T08:45:53.750808Z","title":"InstantFam- ily: Masked Attention for Zero-shot Multi-ID Image Generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:53.750808Z"},"links":{"cited_paper":"/paper/2404.19427","citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:f37f6a462b9ab944795d204fe4654153fa41fc4b0b0c51ea904290e6df83f13a","observation_id":"57edd10e-546e-436e-8861-bd09e26538d4","resolution":{"observed_at":"2026-08-01T08:45:53.750808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:53.864276Z","title":"Z.; Shi, Y .; Chen, Y .; Fan, Z.; Xiao, W.; Zhao, R.; Chang, S.; Wu, W.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:53.864276Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:a69267bf80ce8b4e54b41012b085d9c840a6fbdd6bf772354f50ace7e682785d","observation_id":"5c2f5e89-be5e-4505-ab83-4167fa72519e","resolution":{"observed_at":"2026-08-01T08:45:53.864276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:53.980171Z","title":"T.; Durand, F.; and Han, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:53.980171Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:410f5d30c36f9290ec7b830fdedd4af99331f84080efb4ab03c4f7e59553dba1","observation_id":"a4488120-ede3-4c7b-aad5-77c802a95fe2","resolution":{"observed_at":"2026-08-01T08:45:53.980171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:54.104811Z","title":"Wang et al., ”StableIdentity: Inserting Anybody into Anywhere at First Sight,” in IEEE Transactions on Multimedia, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:54.104811Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:50e10f1cdb91b32efeb54afeb004e41e34a7327c6de89ebe40c953380be78732","observation_id":"9674dc1c-ebe5-4b26-9a5a-c5c319b477c9","resolution":{"observed_at":"2026-08-01T08:45:54.104811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:54.187980Z","title":"Moa: Mixture-of-attention for subject-context disentanglement in person- alized image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:54.187980Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:389ab1cd5e62426d69b1e725b8ae0299e5ea943ccdcc3468932a29d870a54c71","observation_id":"4eee05e7-9df3-4ded-bc7f-9388351152a5","resolution":{"observed_at":"2026-08-01T08:45:54.187980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05939","last_updated":"2024-09-06T14:44:12Z","snapshot_observed_at":"2026-07-06T18:59:29.568123Z","submitted_at":"2024-08-12T06:27:29Z","title":"UniPortrait: A Unified Framework for Identity-Preserving Single- and Multi-Human Image Personalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05939","snapshot_observed_at":"2026-08-01T08:45:54.264478Z","title":"Uniportrait: A unified framework for identity- preserving single-and multi-human image personalization[J]","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:54.264478Z"},"links":{"cited_paper":"/paper/2408.05939","citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:419d1d75100eb4ba91eec4a5b80cebf09d8d4d2ea4b04a6b1dcb5b1dd547a5a9","observation_id":"9c30dbaf-a471-4e77-affc-d426df0c0b79","resolution":{"observed_at":"2026-08-01T08:45:54.264478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:54.387514Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:54.387514Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:4c3c22017dd3ff2b44814838350fcbab2c8d02660386e0c4ffc4098b80debe6a","observation_id":"660a1039-2c13-4019-a163-942f9a440ec2","resolution":{"observed_at":"2026-08-01T08:45:54.387514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:54.496271Z","title":"Prompt disentanglement via language guidance and representation alignment for domain generalization","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:54.496271Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:f6f8bf1abde7c342d9be5ea7a34f2bc476e030ec7248daccb902639b67133d17","observation_id":"9263479e-2623-41ce-8c90-3255123cf0d5","resolution":{"observed_at":"2026-08-01T08:45:54.496271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:54.623013Z","title":"Isolating Interference Factors for Robust Cloth-Changing Person Re-Identification","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:54.623013Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:96052657bae3a3c045aced9ea38a42585ac187b661f329b194ebb9324606e2d2","observation_id":"5b1a376d-3df0-45e6-86d9-d2df267195c9","resolution":{"observed_at":"2026-08-01T08:45:54.623013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:54.748922Z","title":"Semantic-Aligned Learning with Collaborative Refinement for Unsupervised VI-ReID","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:54.748922Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:0083b1fa06a09ad796d855ee7a4f8c40c684411e4815e8c5cc9534034a47c0af","observation_id":"1045384a-ebfc-405b-b663-7e630c8beb6b","resolution":{"observed_at":"2026-08-01T08:45:54.748922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:54.876312Z","title":"Arcface: Additive an- gular margin loss for deep face recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:54.876312Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:563a3b2dba83d43e6c2fb8d500c2311d18e2b40f951a678cf0c57f30ab2bef17","observation_id":"5c604d6c-64b5-455d-a0ca-d5e11d37c6a1","resolution":{"observed_at":"2026-08-01T08:45:54.876312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:55.017512Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:55.017512Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:41539f307868bcf585eb47f314ccc9f8c50d9ad9ad890b880582540af6ba9a95","observation_id":"c3ceb86b-0cfd-4972-b063-d3adfe16fa23","resolution":{"observed_at":"2026-08-01T08:45:55.017512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:55.192855Z","title":"C.; Cai, W.; and Wu, W","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:55.192855Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:63980a37f62fed370648b0c8788cbe04610668175e5c49d221627c9aca23231c","observation_id":"e7cbcd72-ae7e-44a3-b208-c31a67f8affa","resolution":{"observed_at":"2026-08-01T08:45:55.192855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-01T08:45:55.326589Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:55.326589Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:e58ef97a97f33a7bc3ecb4bdbd7702296aad915d7798643e5ba9af9834d7f1cd","observation_id":"905c32c9-bc04-4fd0-b72b-e918be86cffc","resolution":{"observed_at":"2026-08-01T08:45:55.326589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:55.498705Z","title":"You only look once: Unified, real-time object detection","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:55.498705Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:99ced1c7b59bb3a4edc13326e6e0e09c0adc5cb5d250635231bd12db300881e1","observation_id":"88eed811-e3ed-4617-b5b7-34feddf62511","resolution":{"observed_at":"2026-08-01T08:45:55.498705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:55.631554Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:55.631554Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:784eaf38f1d495c869b5be45bcbf744ab4b9462ee45dc9984feeb7967a98ab7d","observation_id":"8f765b00-60ec-4d34-be47-d10aebbc786d","resolution":{"observed_at":"2026-08-01T08:45:55.631554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-01T08:45:55.863782Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:55.863782Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:ed61448b041f1e9b645039db2391f4595eb78a2d7074a011e37bf369ddf44fc9","observation_id":"95705e5c-a329-434e-8266-0bec69185265","resolution":{"observed_at":"2026-08-01T08:45:55.863782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14151","last_updated":"2025-07-02T11:55:35Z","snapshot_observed_at":"2026-08-07T16:55:11.462308Z","submitted_at":"2025-03-18T11:17:32Z","title":"Concat-ID: Towards Universal Identity-Preserving Video Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14151","snapshot_observed_at":"2026-08-01T08:45:55.949098Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:55.949098Z"},"links":{"cited_paper":"/paper/2503.14151","citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:984d84464dbcec57ca459b0777ca693c4a2bb7fddf3797262d615c7794055cbc","observation_id":"48c89310-2f36-4c5b-817c-ef31ff4fec05","resolution":{"observed_at":"2026-08-01T08:45:55.949098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:56.022224Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:56.022224Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:3e124c0e16ccda659d3b9030cebf1f13a007302edbeb204d2b3397fc14c42d51","observation_id":"6a0ab88e-903f-40c6-8814-7232c89e803e","resolution":{"observed_at":"2026-08-01T08:45:56.022224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:56.070192Z","title":"Facenet: A unified embedding for face recognition and clustering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:56.070192Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:d65b52ad3c6751cfa15c0f072579a2eab1b0aa1688085d71e1f63f1b3f516cd2","observation_id":"31b07728-66f6-412e-9c74-2fb5a5f7264f","resolution":{"observed_at":"2026-08-01T08:45:56.070192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-01T08:45:56.145247Z","title":"L.; and Choi, Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:56.145247Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:29a46919f50c33bceede5e827e86456ab32079523bbb1d55e6de6247c49e2ff1","observation_id":"b7b3befd-d387-4e60-a430-ca0a169c8d65","resolution":{"observed_at":"2026-08-01T08:45:56.145247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:56.233802Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:56.233802Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:5aa7dfd3876b736e0bbf32b3a141f06f235823aef6179a913496bacd93c39288","observation_id":"098e84f8-7205-4552-aed7-c545aed5d8c3","resolution":{"observed_at":"2026-08-01T08:45:56.233802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:45:56.369880Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:56.369880Z"},"links":{"citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:a8acb70b1ef5ba9e3f3a37244a3a2a0529b014dbc0847e23465f861f022fcebb","observation_id":"35792e90-8689-4c82-9045-a7cca4861254","resolution":{"observed_at":"2026-08-01T08:45:56.369880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-01T08:45:56.546648Z","title":"Wan: Open and advanced large-scale video generative models, 2025, arXiv preprint arXiv:2503.20314","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:56.546648Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:96f6bb7ad215a18457bb8ee6aa5c4626e01de9fbf600960445c98106e0303938","observation_id":"120d1f0b-33e7-4426-bb2f-fa0eaa08e5ef","resolution":{"observed_at":"2026-08-01T08:45:56.546648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-01T08:45:55.760903Z","title":"arXiv preprint arXiv:2408.00714","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:55.760903Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:b0152dce4cd29d6fca46bc9fd54bfe41085d4e4fcccb633109444b154ba25bf5","observation_id":"e46cf379-e30f-47d9-8488-fb037c77e821","resolution":{"observed_at":"2026-08-01T08:45:55.760903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05091","last_updated":"2026-04-10T06:19:25Z","snapshot_observed_at":"2026-07-06T22:09:13.286008Z","submitted_at":"2025-08-07T07:19:02Z","title":"PoseGen: In-Context LoRA Finetuning for Pose-Controllable Long Human Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05091","snapshot_observed_at":"2026-08-01T08:45:52.437732Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T08:45:52.437732Z"},"links":{"cited_paper":"/paper/2508.05091","citing_paper":"/paper/2607.21027"},"observation_digest":"sha256:39be00f7d45c6d61c972f79ca68dbf81f45c92c1139a909be3d9c21e8d760c7a","observation_id":"fbf45139-c00d-49f8-bc20-0138b7e78cc1","resolution":{"observed_at":"2026-08-01T08:45:52.437732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.21027","last_updated":"2026-07-23T08:09:04Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-01T08:45:46.610085Z","submitted_at":"2026-07-23T08:09:04Z","title":"GroupVideo: Multi-Identity Customized Text-to-Video Generation"},"reference_resolution":{"displayed":83,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":83,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":83},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 83 of 83 outbound references and 0 inbound Pith citation observations for arXiv:2607.21027."}