{"as_of":"2026-08-08T03:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5a3c095c79b8f4d1647447264484fb5b45b27ae3a85d3113a295e7acb218da2d","coverage":[{"denominator":122,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:39:40.471781Z","state":"measured"},{"denominator":104,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":104,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:53:27.675148Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T05:17:40.170733Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18078","snapshot_observed_at":"2026-08-06T18:53:27.675148Z","title":"Dancetogether! identity-preserving multi-person interactive video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07095","last_updated":"2025-07-09T17:52:04Z","snapshot_observed_at":"2026-08-06T18:45:14.871573Z","submitted_at":"2025-07-09T17:52:04Z","title":"Go to Zero: Towards Zero-shot Motion Generation with Million-scale Data","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:27.675148Z"},"links":{"cited_paper":"/paper/2505.18078","citing_paper":"/paper/2507.07095"},"observation_digest":"sha256:a9298e58adc773b87174ff48cba6892eba8abf147df71b4f6579e2d1c00ac9f2","observation_id":"5f61ef65-53ed-4d52-ac84-5f8dcce9fa77","resolution":{"observed_at":"2026-08-06T18:53:27.675148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18078","snapshot_observed_at":"2026-08-05T21:09:08.459299Z","title":"Dancetogether! identity-preserving multi- person interactive video generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09454","last_updated":"2025-08-13T03:11:28Z","snapshot_observed_at":"2026-08-07T21:53:02.449995Z","submitted_at":"2025-08-13T03:11:28Z","title":"Animate-X++: Universal Character Image Animation with Dynamic Backgrounds","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T21:09:08.459299Z"},"links":{"cited_paper":"/paper/2505.18078","citing_paper":"/paper/2508.09454"},"observation_digest":"sha256:ece69d7b306f1fdcc9a7608b54183e6af581f1bdedc11c595e1220806e254a99","observation_id":"f3b5af5a-7f4e-483f-9830-8d65451aa8f7","resolution":{"observed_at":"2026-08-05T21:09:08.459299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"cited_work":{"arxiv_id":"2505.18078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18078","snapshot_observed_at":"2026-07-03T05:17:40.170733Z","title":"Dancetogether! identity-preserving multi-person interactive video generation","venue":null,"work_id":"f14b67e4-d7e1-46a9-8d39-97c29f2f1836","year":2025},"citing_paper":{"arxiv_id":"2605.10079","last_updated":"2026-05-11T07:01:38Z","snapshot_observed_at":"2026-07-06T23:22:03.830881Z","submitted_at":"2026-05-11T07:01:38Z","title":"SocialDirector: Training-Free Social Interaction Control for Multi-Person Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T03:28:30.471533Z"},"links":{"cited_paper":"/paper/2505.18078","citing_paper":"/paper/2605.10079"},"observation_digest":"sha256:8c9e499ba1f71f76bc55aa7d8a9a8a9cce785e394dd58214d1116a78b0094426","observation_id":"62c4e2ef-c1ee-42c1-88c8-37f3ddddffe0","resolution":{"observed_at":"2026-05-12T07:21:23.832707Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"cited_work":{"arxiv_id":"2505.18078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18078","snapshot_observed_at":"2026-07-03T05:17:40.170733Z","title":"Dancetogether! identity-preserving multi-person interactive video generation","venue":null,"work_id":"f14b67e4-d7e1-46a9-8d39-97c29f2f1836","year":2025},"citing_paper":{"arxiv_id":"2606.10804","last_updated":"2026-08-05T01:57:13Z","snapshot_observed_at":"2026-08-08T03:10:05.999676Z","submitted_at":"2026-06-09T12:49:34Z","title":"SCAIL-2: Unifying Controlled Character Animation with End-to-End In-Context Conditioning","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-27T13:21:00.443497Z"},"links":{"cited_paper":"/paper/2505.18078","citing_paper":"/paper/2606.10804"},"observation_digest":"sha256:bb2d0d6c72a6e3a8f79bb4cd8ba0c8713392df84d68bfd2c1e445fb8f825d35d","observation_id":"b5a0b152-3b45-4e4e-8e3e-791cba101049","resolution":{"observed_at":"2026-07-03T05:17:40.172362Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18078/citation-record","integrity":"/paper/2505.18078/integrity","json":"/paper/2505.18078/citation-record.json","paper":"/paper/2505.18078"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:27.854249Z","title":"Kling ai: Next-generation ai creative studio","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:27.854249Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:22add4c9d8ae2c24d9406491197c79893644d9889f0efe8208edc877747c1bf0","observation_id":"2900a376-f8b4-4b1b-99e2-9c70f8521af7","resolution":{"observed_at":"2026-08-07T14:39:27.854249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10626","last_updated":"2025-03-13T17:59:24Z","snapshot_observed_at":"2026-08-07T17:06:09.678945Z","submitted_at":"2025-03-13T17:59:24Z","title":"NIL: No-data Imitation Learning by Leveraging Pre-trained Video Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10626","snapshot_observed_at":"2026-08-07T14:39:27.962933Z","title":"Nil: No- data imitation learning by leveraging pre-trained video diffusion models.arXiv preprint arXiv:2503.10626, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:27.962933Z"},"links":{"cited_paper":"/paper/2503.10626","citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:0e47ff5377bf0d3fb2f63210b848bbd14804f38f9001ef6a51e95e1d04a427d4","observation_id":"1168006f-b201-49e8-9707-34b34f9389b7","resolution":{"observed_at":"2026-08-07T14:39:27.962933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:28.058069Z","title":"Evaluating multiple object tracking performance: the clear mot metrics.EURASIP Journal on Image and Video Processing, 2008:1–10, 2008","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:28.058069Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:072a6c603addd9a319c2cd7ae1823f0f3d80f6ba807f4c5d62b4a786d0437518","observation_id":"600e7f26-f3fa-4eeb-b067-daa256352da9","resolution":{"observed_at":"2026-08-07T14:39:28.058069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-08-07T14:39:28.179162Z","title":"Gen2act: Human video generation in novel scenarios enables generalizable robot manipulation.arXiv preprint arXiv:2409.16283, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:28.179162Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:674a4822c2a60e5294f83f023b66cac20794747281c269fa3920dd020e79defa","observation_id":"e47415ba-09ac-47d7-9104-881ef902dfbf","resolution":{"observed_at":"2026-08-07T14:39:28.179162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T14:39:28.316171Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:28.316171Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:5f148744b7b03e247b2dbfee829879b17bb83ef58bed50a04ee13e13707ee846","observation_id":"df3c0f70-42af-4cd7-8b4c-70e5deb96fb6","resolution":{"observed_at":"2026-08-07T14:39:28.316171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:28.432698Z","title":"Align your latents: High-resolution video synthesis with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:28.432698Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:ab5c0169990a87ea8a6d9853cb7952116b535e0d34a370cb52279831d297f0a6","observation_id":"957d04fc-d08e-4f4d-8e24-11439fcae46a","resolution":{"observed_at":"2026-08-07T14:39:28.432698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04666","last_updated":"2025-03-06T17:59:29Z","snapshot_observed_at":"2026-08-07T17:24:01.396925Z","submitted_at":"2025-03-06T17:59:29Z","title":"What Are You Doing? A Closer Look at Controllable Human Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04666","snapshot_observed_at":"2026-08-07T14:39:28.537052Z","title":"What are you doing? a closer look at controllable human video generation.arXiv preprint arXiv:2503.04666, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:28.537052Z"},"links":{"cited_paper":"/paper/2503.04666","citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:734883252b368bb519ed2503a0ed581bf9efe602cfbff997a174b087c3c71760","observation_id":"cdf151f3-4e91-4d33-902e-62499e8bd14a","resolution":{"observed_at":"2026-08-07T14:39:28.537052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:28.702062Z","title":"Deep video generation, prediction and completion of human action sequences","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:28.702062Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:1b8fd4ad646298703bd4fcab6a2b69fd032a044438cad0d53aa92593a0cd18fd","observation_id":"b2f98aa9-0a88-4e9a-9f9a-d44c9902f925","resolution":{"observed_at":"2026-08-07T14:39:28.702062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:28.910813Z","title":"Realtime multi-person 2d pose estimation using part affinity fields","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:28.910813Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:68f2bfb76cc912f46f58ea75a6c0322eeaff213b2e5f595ff622dbd436118aab","observation_id":"c227ce5b-e088-42c4-b987-b010f71ce6e2","resolution":{"observed_at":"2026-08-07T14:39:28.910813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:29.012468Z","title":"Everybody dance now","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:29.012468Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:f89511ba4013abda948859a14959fac6e39dbe8d21c618990f96bd7c2cefbc5b","observation_id":"fe4bec42-cecc-420a-8afe-80132b8a15a3","resolution":{"observed_at":"2026-08-07T14:39:29.012468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:29.121664Z","title":"A survey on evaluation of large language models.ACM transactions on intelligent systems and technology, 15(3):1–45, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:29.121664Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:adf6c363c91f79606628a00b3d523c07dc7673f4321b299e1003a3543995e856","observation_id":"a11af6a5-570e-4f38-841b-c9cc3c9f17a0","resolution":{"observed_at":"2026-08-07T14:39:29.121664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:29.276838Z","title":"Idea23d: Collaborative lmm agents enable 3d model generation from interleaved multimodal inputs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:29.276838Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:d2fa269e1c024873e8c10bb993b935eecbed28fa1c8288faad90b809f6281707","observation_id":"44b5296a-29b9-49a1-b2ca-279347e69f5a","resolution":{"observed_at":"2026-08-07T14:39:29.276838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:29.431038Z","title":"Ultraman: Ultra-fast and high-resolution texture generation for 3d human reconstruction from a single image","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:29.431038Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:5fc437e5823313e85bd3616b417ae52abefcf60054408073816af58fcdfcd058","observation_id":"5ee3d724-3094-49fa-ae27-139edab772e8","resolution":{"observed_at":"2026-08-07T14:39:29.431038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01055","last_updated":"2024-09-02T08:28:57Z","snapshot_observed_at":"2026-07-06T19:09:10.244642Z","submitted_at":"2024-09-02T08:28:57Z","title":"Follow-Your-Canvas: Higher-Resolution Video Outpainting with Extensive Content Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01055","snapshot_observed_at":"2026-08-07T14:39:29.576107Z","title":"Follow-your-canvas: Higher-resolution video outpainting with extensive content generation.arXiv preprint arXiv:2409.01055, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:29.576107Z"},"links":{"cited_paper":"/paper/2409.01055","citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:a47f4e3ec6db630e8f2d7d2b201c5259efd980fcc52824a83c611362cbe2a840","observation_id":"0787fcbb-8a67-45a3-bacf-9a7be07ce9da","resolution":{"observed_at":"2026-08-07T14:39:29.576107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:29.716317Z","title":"Control3d: Towards controllable text-to-3d generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:29.716317Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:6812f46bc58c451b7451a821e365177d10d79c9512741218714ea0c5311a9845","observation_id":"c6267999-d86e-4c8f-be8a-773bfa80472c","resolution":{"observed_at":"2026-08-07T14:39:29.716317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:29.878018Z","title":"Abo: Dataset and benchmarks for real-world 3d object understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:29.878018Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:901d930bdc159b07a1427943ada74039b85ea3388e73f90339d6984c891d79c4","observation_id":"02698d6c-1116-4086-82a6-f5fe84d2b928","resolution":{"observed_at":"2026-08-07T14:39:29.878018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:29.971259Z","title":"Arcface: Additive angular margin loss for deep face recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:29.971259Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:3559fd4600fd490e1e270491a9b5be107b0c8264b28f626972a93415e8caa74b","observation_id":"ef74ef35-882e-452e-8674-9c4390b03984","resolution":{"observed_at":"2026-08-07T14:39:29.971259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12052","last_updated":"2024-05-05T05:07:34Z","snapshot_observed_at":"2026-08-01T16:10:16.293275Z","submitted_at":"2023-11-18T10:22:44Z","title":"MagicPose: Realistic Human Poses and Facial Expressions Retargeting with Identity-aware Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12052","snapshot_observed_at":"2026-08-07T14:39:30.078011Z","title":"Magicdance: Realistic human dance video generation with motions & facial expressions transfer.arXiv preprint arXiv:2311.12052, 2(3):4, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:30.078011Z"},"links":{"cited_paper":"/paper/2311.12052","citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:4c9aecdc2f9ad8ffa9879004355a41c606451ddbf59d32ea1456f1a0fb13fa52","observation_id":"e60f2730-3902-4bdd-b390-6833cb5fff33","resolution":{"observed_at":"2026-08-07T14:39:30.078011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:30.203373Z","title":"Image quality assessment: Unifying structure and texture similarity.IEEE transactions on pattern analysis and machine intelligence, 44(5):2567–2581, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:30.203373Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:42d03438969561c3c3d17bf4e19ece258d3d7bb3b61f53d22f1aa0037d3a52a4","observation_id":"267dda78-9c90-4817-b5f6-b6137d6b873f","resolution":{"observed_at":"2026-08-07T14:39:30.203373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:30.357678Z","title":"A survey of embodied ai: From simulators to research tasks.IEEE Transactions on Emerging Topics in Computational Intelligence, 6(2):230–244, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:30.357678Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:4a40b83796d4da5b36ae90ddf3cadd16caffff4c85b4d762b573aa7e02a9109f","observation_id":"3a8d5778-848c-46ab-8ac9-064bf19ec487","resolution":{"observed_at":"2026-08-07T14:39:30.357678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05107","last_updated":"2023-12-11T11:00:13Z","snapshot_observed_at":"2026-07-06T16:58:51.683654Z","submitted_at":"2023-12-08T15:37:17Z","title":"DreaMoving: A Human Video Generation Framework based on Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05107","snapshot_observed_at":"2026-08-07T14:39:30.469507Z","title":"Dreamoving: A human video generation framework based on diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:30.469507Z"},"links":{"cited_paper":"/paper/2312.05107","citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:23f12296a34d9e3eb5832b1427eb77ae01b8e533256d526425960489233414e2","observation_id":"7e3136c8-8dd5-40fd-abf9-f1c597ca576e","resolution":{"observed_at":"2026-08-07T14:39:30.469507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01854","last_updated":"2023-08-04T08:34:23Z","snapshot_observed_at":"2026-08-05T02:26:29.801073Z","submitted_at":"2023-08-03T16:20:33Z","title":"Reconstructing Three-Dimensional Models of Interacting Humans","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01854","snapshot_observed_at":"2026-08-07T14:39:30.578026Z","title":"Reconstructing three-dimensional models of interacting humans.arXiv preprint arXiv:2308.01854, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:30.578026Z"},"links":{"cited_paper":"/paper/2308.01854","citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:fcfc9adc37fb72926fc2b9309cf5f7b7d8f32431783d05074309eb9976bc68f0","observation_id":"a156db48-51d7-49dd-973d-9dd3e69652f7","resolution":{"observed_at":"2026-08-07T14:39:30.578026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:30.706731Z","title":"Iw-bench: Evaluating large multimodal models for converting image-to-web","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:30.706731Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:582d50c6384aee2625c3c756803db072bab34fb49d7990325466f7a214020eed","observation_id":"24d1dbb2-82b1-4de1-a26f-aa50f20d428f","resolution":{"observed_at":"2026-08-07T14:39:30.706731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18525","last_updated":"2025-08-27T08:24:52Z","snapshot_observed_at":"2026-07-06T18:21:35.476139Z","submitted_at":"2024-05-28T18:45:10Z","title":"REPARO: Compositional 3D Assets Generation with Differentiable 3D Layout Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18525","snapshot_observed_at":"2026-08-07T14:39:30.852424Z","title":"Reparo: Compositional 3d assets generation with differentiable 3d layout alignment.arXiv preprint arXiv:2405.18525, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:30.852424Z"},"links":{"cited_paper":"/paper/2405.18525","citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:fd86788f8e9cae33cfa8add0b821a318a43ac655fc92980a3f46f45599b2f7de","observation_id":"a5f23d6e-e533-4821-bd2f-20bd4b8923be","resolution":{"observed_at":"2026-08-07T14:39:30.852424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:31.000337Z","title":"Controllable video generation with sparse trajectories","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:31.000337Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:bf27dedb0748237d64c1a2b2a6f724ad18f121e30a778041ec85764a723fe7bd","observation_id":"3a2db74a-06c7-4702-a933-436efdfd1d1a","resolution":{"observed_at":"2026-08-07T14:39:31.000337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:31.077064Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:31.077064Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:a81439f447374b02a673b4547d95821a229e53226919fc341dd4ea84c487cd82","observation_id":"966235b4-d245-45a2-adbe-c8cce4d0a6cd","resolution":{"observed_at":"2026-08-07T14:39:31.077064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:31.195892Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:31.195892Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:100f62599b8097883926b3925c23359bd1f6f445d5469a9a59f8ef3ef2be4cb5","observation_id":"2ac61a93-afe7-4117-a40d-0a7215b9d292","resolution":{"observed_at":"2026-08-07T14:39:31.195892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:31.330830Z","title":"Video diffusion models.Advances in Neural Information Processing Systems, 35:8633–8646, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:31.330830Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:4a6cdce2f2d51a1c375c2b4f1af82a16b3c0556e524725f355d0451825d5d0a1","observation_id":"19b36b3b-9e7e-4807-b977-68aadc3a9386","resolution":{"observed_at":"2026-08-07T14:39:31.330830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:31.448865Z","title":"Animate anyone: Consistent and controllable image-to-video synthesis for character animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:31.448865Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:fe69689ec70479edbc01c814ef72abb59b07c9874e89a2792ba43e1c166a1bab","observation_id":"3a338dd0-f641-4126-ad46-10370e14664c","resolution":{"observed_at":"2026-08-07T14:39:31.448865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:31.551390Z","title":"Make it move: controllable image-to-video generation with text descriptions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:31.551390Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:e814f241cff9279504b85f52a5af47139d35e79de7cc6a2043d25dc3941e15a6","observation_id":"4bdc7f19-0ce8-4b8d-a1cd-666550d4a03d","resolution":{"observed_at":"2026-08-07T14:39:31.551390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:31.697935Z","title":"T2i-compbench: A comprehensive benchmark for open-world compositional text-to-image generation.Advances in Neural Information Processing Systems, 36:78723–78747, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:31.697935Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:dcf8f62fc4ffee40083e8951b98d3a45bcf03d4df510756e4f287349e5cc5c50","observation_id":"148131a0-b0cb-4168-8428-04eda8d52060","resolution":{"observed_at":"2026-08-07T14:39:31.697935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:31.816062Z","title":"Learning high fidelity depths of dressed humans by watching social media dance videos","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:31.816062Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:87eebac48069782dbf8de0847a2091c596d048bcc25896203933d57b9832a49d","observation_id":"7c81c201-5c26-4245-a1ca-67ffbeecd471","resolution":{"observed_at":"2026-08-07T14:39:31.816062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:31.952185Z","title":"Yolo by ultralytics","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:31.952185Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:f49adf78fbda1b28b682cdd943ab06be9a049521a947cd975328b767da0f3f60","observation_id":"d2601d8f-14fd-4923-a6b3-ebbbfd91843f","resolution":{"observed_at":"2026-08-07T14:39:31.952185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:32.041557Z","title":"Dreampose: Fashion image-to-video synthesis via stable diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:32.041557Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:07300b692ad43f73e6247171da9439028ae4d0ad080d8341c800604cf034c96f","observation_id":"7acefeae-4451-407b-95f2-9d10240b0820","resolution":{"observed_at":"2026-08-07T14:39:32.041557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:32.189957Z","title":"Text2video-zero: Text-to-image diffusion models are zero-shot video generators","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:32.189957Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:5a8ed3dc25166b274cee28d353cc252dfe50a481431fd0cafc24bdfc819724e2","observation_id":"c32c5365-7c35-42a8-a1d0-3d0489a46a4a","resolution":{"observed_at":"2026-08-07T14:39:32.189957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:32.335868Z","title":"Harmony4d: A video dataset for in-the-wild close human interactions.Advances in Neural Information Processing Systems, 37:107270–107285, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:32.335868Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:f7f335e875b69f4e2fff21ce6ab7a9b8c352016ff233e4226745a0a7512fad90","observation_id":"a70eeb23-462f-4a78-8dd7-4da9da819357","resolution":{"observed_at":"2026-08-07T14:39:32.335868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-07T14:39:32.441384Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:32.441384Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:e814a551249bac21c7bc870928c148944c7c37306e656f397afd2798bb393ba0","observation_id":"27af0b82-7793-48ce-826a-09120dbb2c87","resolution":{"observed_at":"2026-08-07T14:39:32.441384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16579","last_updated":"2025-03-20T12:25:36Z","snapshot_observed_at":"2026-08-07T16:49:22.047069Z","submitted_at":"2025-03-20T12:25:36Z","title":"World Knowledge from AI Image Generation for Robot Control","version":1},"cited_work":{"arxiv_id":"2503.16579","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.16579","snapshot_observed_at":"2026-08-07T14:39:44.293852Z","title":"World Knowledge from AI Image Generation for Robot Control","venue":"cs.CV","work_id":"5ee8be70-375e-46bf-ac75-912eb60dedb6","year":2025},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:32.544278Z"},"links":{"cited_paper":"/paper/2503.16579","citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:c3530c599396e8caf96139b8d8b188b1ca901a189ec36ea9dd5b78b9ad4586a1","observation_id":"0f9e282f-c51b-434d-9c89-643ac36b716c","resolution":{"observed_at":"2026-08-07T14:39:44.390335Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:32.667049Z","title":"Collaborative video diffusion: Consistent multi-video generation with camera control.Advances in Neural Information Processing Systems, 37:16240–16271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:32.667049Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:9a0046e3c0d33c65a3968d44707d5e51593c7ce8048f5b7855247227412dac29","observation_id":"e9fad175-df89-4ddd-9db3-16588d30dcb2","resolution":{"observed_at":"2026-08-07T14:39:32.667049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:32.784501Z","title":"Interactive control of avatars animated with human motion data","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:32.784501Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:4e8d3c602cd73b31111115b82c5d8b82357f83006ceca4830b9f0975216dc1a6","observation_id":"71d895b1-7f2a-435b-95e4-ea3e890f6c3f","resolution":{"observed_at":"2026-08-07T14:39:32.784501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:32.929080Z","title":"Dispose: Disentangling pose guidance for controllable human image animation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:32.929080Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:c7e098f21b23dd54a6dda25173d772cbd003d807792dc19feb85bd5188184355","observation_id":"78117396-776c-4748-833d-7021096a11d7","resolution":{"observed_at":"2026-08-07T14:39:32.929080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:33.077966Z","title":"Magicmotion: Controllable video generation with dense-to-sparse trajectory guidance.arXiv preprint arXiv:2503.16421, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:33.077966Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:b934e1ea2a69858106a5af2a2af9890b3ca8dc4c104af8081257fa1d9de6f413","observation_id":"1cea47e6-c866-4cac-9f51-982f745f81b1","resolution":{"observed_at":"2026-08-07T14:39:33.077966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:33.241476Z","title":"Ai choreographer: Music conditioned 3d dance generation with aist++","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:33.241476Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:f69e5689290871c2ee9fd8f726a150ae9bfca3e4621b12bf9b474c4621a5ee19","observation_id":"d78f8ca3-ebb4-4682-8bc1-a86e74cae192","resolution":{"observed_at":"2026-08-07T14:39:33.241476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:33.415877Z","title":"Lodge: A coarse to fine diffusion network for long dance generation guided by the characteristic dance primitives","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:33.415877Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:1867ae05efe626471e04d7a5c7b7c5d37e9c3b37167f8295d323ffb6b93e3ccc","observation_id":"441d9249-c4c1-4ea9-ad25-9693c9ecd598","resolution":{"observed_at":"2026-08-07T14:39:33.415877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:33.524998Z","title":"Finedance: A fine-grained choreography dataset for 3d full body dance generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:33.524998Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:e8ea64b7bcd8df2ec2e3e18d96c790bca382f46d119a54353e948a74419ce496","observation_id":"c8951d2e-04fe-4d05-b8e8-5767a0fe2ab1","resolution":{"observed_at":"2026-08-07T14:39:33.524998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:33.655440Z","title":"Evaluation of text-to-video generation models: A dynamics perspective.Advances in Neural Information Processing Systems, 37:109790–109816, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:33.655440Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:a8b533a92b59ed2d27db0fcdab69f420ed4e9883919a35193ebb27bbebe472f2","observation_id":"ae3446fd-c7f8-491e-a946-312f88190ce6","resolution":{"observed_at":"2026-08-07T14:39:33.655440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00131","snapshot_observed_at":"2026-08-07T14:39:33.784524Z","title":"Open-sora plan: Open-source large video generation model.arXiv 12 preprint arXiv:2412.00131, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:33.784524Z"},"links":{"cited_paper":"/paper/2412.00131","citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:06f413eb402d3a5ce94c115820114c66ce8bf8843af84d25c2265f6005d56238","observation_id":"eba97441-0e2c-47f4-b193-0346b6d5c10a","resolution":{"observed_at":"2026-08-07T14:39:33.784524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:33.911487Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:33.911487Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:a260807326e12abf761f3bfbdea83b41a88fe12de9cba6003007d54f7f6f2c1c","observation_id":"561c3ced-6317-4037-96e2-0760abce90d3","resolution":{"observed_at":"2026-08-07T14:39:33.911487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:34.080061Z","title":"Rich: Robust implicit clothed humans reconstruction from multi-scale spatial cues","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:34.080061Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:46306996633135a9dd2d9f8b82cc1856779671e348668e8e90eae5489c50320e","observation_id":"5eecf7a7-32db-4588-a5a7-6b9a37951ff3","resolution":{"observed_at":"2026-08-07T14:39:34.080061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16124","last_updated":"2024-07-23T02:10:50Z","snapshot_observed_at":"2026-08-07T22:23:37.324306Z","submitted_at":"2024-07-23T02:10:50Z","title":"Fr\\'echet Video Motion Distance: A Metric for Evaluating Motion Consistency in Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16124","snapshot_observed_at":"2026-08-07T14:39:34.232980Z","title":"Fr \\’echet video motion distance: A metric for evaluating motion consistency in videos.arXiv preprint arXiv:2407.16124, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:34.232980Z"},"links":{"cited_paper":"/paper/2407.16124","citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:df8a670ee035477101997e81d9f011f878677c0963144d81470386886af86f29","observation_id":"70b16e33-f959-4153-8202-71429bf008e1","resolution":{"observed_at":"2026-08-07T14:39:34.232980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:34.359389Z","title":"Evalcrafter: Benchmarking and evaluating large video generation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:34.359389Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:426732e04afb445d1d0ce35a9c2e57e6bbf1b59d1baad696e6bdb9e2156e0c3f","observation_id":"7c276a2c-8df3-43f3-ac91-74cc9c55b17b","resolution":{"observed_at":"2026-08-07T14:39:34.359389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:34.496802Z","title":"Fetv: A benchmark for fine-grained evaluation of open-domain text-to-video generation.Advances in Neural Information Processing Systems, 36:62352–62387, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:34.496802Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:e14680f82014678c1cef983879f3cecf9c4f6c4a5726b6555fdbfb00ea48ec32","observation_id":"866f235c-51e3-4a8a-90fd-f5a545b88ed9","resolution":{"observed_at":"2026-08-07T14:39:34.496802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:34.644160Z","title":"Hota: A higher order metric for evaluating multi-object tracking.International Journal of Computer Vision, 129(2):548–578, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:34.644160Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:1e3c333a202cc6c43b65962ad83ad06c50eccfb11d9f25c9d2d4e36204bdea00","observation_id":"55ef3d96-bbc4-445e-a9ff-abcd5bbf4852","resolution":{"observed_at":"2026-08-07T14:39:34.644160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01724","last_updated":"2025-04-20T11:52:01Z","snapshot_observed_at":"2026-08-07T16:14:38.838654Z","submitted_at":"2025-04-02T13:30:32Z","title":"DreamActor-M1: Holistic, Expressive and Robust Human Image Animation with Hybrid Guidance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01724","snapshot_observed_at":"2026-08-07T14:39:34.790939Z","title":"Dreamactor-m1: Holistic, expressive and robust human image animation with hybrid guidance.arXiv preprint arXiv:2504.01724, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:34.790939Z"},"links":{"cited_paper":"/paper/2504.01724","citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:5e84a35065fa22147999077062bdce62b48d69aca41e67962456e451a20aabe7","observation_id":"700ba6c6-ae3e-4c95-970e-c8e24237ad65","resolution":{"observed_at":"2026-08-07T14:39:34.790939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:34.892799Z","title":"Notice of removal: Videofusion: Decomposed diffusion models for high-quality video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:34.892799Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:036622485aeb27f64d8bfc7d2c8408146e1d4627efbc77e00135a44f51d0d83a","observation_id":"2eecacde-9246-4bbe-862e-d50b89449f80","resolution":{"observed_at":"2026-08-07T14:39:34.892799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:35.023802Z","title":"Follow your pose: Pose-guided text-to-video generation using pose-free videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:35.023802Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:49e0747879eb26ce462891d9b49e158034083d19f1be10628643cebe105fcae7","observation_id":"bfc92c3e-e5f4-4101-aed4-172674a16189","resolution":{"observed_at":"2026-08-07T14:39:35.023802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:35.160080Z","title":"Foundation models for video understanding: A survey.Authorea Preprints, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:35.160080Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:78dc3ba820fc71abe21711c8ae90188333595baabf2204b2ca13ddac9a018de2","observation_id":"da0f7099-f544-417d-8f8a-38e68d11bd91","resolution":{"observed_at":"2026-08-07T14:39:35.160080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04440","last_updated":"2024-09-06T17:59:01Z","snapshot_observed_at":"2026-07-06T19:11:40.618767Z","submitted_at":"2024-09-06T17:59:01Z","title":"Synergy and Synchrony in Couple Dances","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04440","snapshot_observed_at":"2026-08-07T14:39:35.320236Z","title":"Synergy and synchrony in couple dances.arXiv preprint arXiv:2409.04440, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:35.320236Z"},"links":{"cited_paper":"/paper/2409.04440","citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:1198bb1d4a453fcdfa2229877db6d9d38dd94be2c185090738760fd686ec9747","observation_id":"9a1ae84c-733b-48a2-bfd4-2a7e08e13cfb","resolution":{"observed_at":"2026-08-07T14:39:35.320236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:50.701710Z","title":"Benchmarking counterfactual image generation.Advances in Neural Information Processing Systems, 37:133207–133230, 2024","venue":null,"work_id":"e90a5949-e0e0-46b6-a544-de1ef12b579f","year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:35.420035Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:2ad5f88f727edad450386a0e86f82d84e74c901610135e4409cbac4b40bf1ba1","observation_id":"b9996c06-4d85-4b26-a5f0-faf946da36cf","resolution":{"observed_at":"2026-08-07T14:39:50.790830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:50.510989Z","title":"Efficient motion weighted spatio-temporal video ssim index","venue":null,"work_id":"6d8b8dc1-c54c-4e08-8284-224317a4eb62","year":2010},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:35.511112Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:dc77496222b0f4c0b8ba06ad1fb591597adb36187373c16d0b6a4d3919921b7e","observation_id":"1d08ed28-1e54-4507-bcb4-c3558f9515f9","resolution":{"observed_at":"2026-08-07T14:39:50.621763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:50.320363Z","title":"Sora: Creating video from text.https://openai.com/sora, 2024","venue":null,"work_id":"7b2e4106-5c9b-43e2-92aa-544b07c5a288","year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:35.638475Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:95e8edafe103eacfcd66224d8b8f08b44c3814dec1eefa577cea097e35174ba3","observation_id":"599b29c2-6318-4b10-8bb1-c61fe0763ba6","resolution":{"observed_at":"2026-08-07T14:39:50.415565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06070","last_updated":"2025-03-08T08:43:03Z","snapshot_observed_at":"2026-07-06T18:59:34.520274Z","submitted_at":"2024-08-12T11:41:18Z","title":"ControlNeXt: Powerful and Efficient Control for Image and Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06070","snapshot_observed_at":"2026-08-07T14:39:35.757677Z","title":"Controlnext: Powerful and efficient control for image and video generation.arXiv preprint arXiv:2408.06070, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:35.757677Z"},"links":{"cited_paper":"/paper/2408.06070","citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:c6b108e470ef82a5168f3f2b3d08fe4aefdb93ed4f1b4c3fb9d16457ebe8f869","observation_id":"1c2473c0-16db-4e18-9f5e-9aa1cc2a423a","resolution":{"observed_at":"2026-08-07T14:39:35.757677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:50.101276Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":"7aa191ce-64ed-463f-b787-8622e94205c9","year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:35.914744Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:54c6f0aeb19a22cb1758501ede7414e0f2a7b8d78cfb4224f96c6b577eff951c","observation_id":"7c9b63c7-f018-40b3-a9ba-7c2120a5f46a","resolution":{"observed_at":"2026-08-07T14:39:50.202694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14988","last_updated":"2022-09-29T17:50:40Z","snapshot_observed_at":"2026-07-06T13:57:54.539656Z","submitted_at":"2022-09-29T17:50:40Z","title":"DreamFusion: Text-to-3D using 2D Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14988","snapshot_observed_at":"2026-08-07T14:39:36.051233Z","title":"Dreamfusion: Text-to-3d using 2d diffusion.arXiv preprint arXiv:2209.14988, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:36.051233Z"},"links":{"cited_paper":"/paper/2209.14988","citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:f9b2233954b59b2bfccf2b5311fcd50d99ef11507c8f45f97e577a84de9e368d","observation_id":"fe34d260-c08b-4195-ba96-e4d7d70a2aec","resolution":{"observed_at":"2026-08-07T14:39:36.051233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18072","last_updated":"2024-10-23T17:56:11Z","snapshot_observed_at":"2026-08-07T10:24:39.020859Z","submitted_at":"2024-10-23T17:56:11Z","title":"WorldSimBench: Towards Video Generation Models as World Simulators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18072","snapshot_observed_at":"2026-08-07T14:39:36.194252Z","title":"Worldsimbench: Towards video generation models as world simulators.arXiv preprint arXiv:2410.18072, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:36.194252Z"},"links":{"cited_paper":"/paper/2410.18072","citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:036b5dc2b2bc2be56a02af6ad1d9a933ce5e47d7121fe964a50077ae2d2bccd0","observation_id":"8174cd73-7e13-4a04-9ccb-9620d9d92d33","resolution":{"observed_at":"2026-08-07T14:39:36.194252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:49.899533Z","title":"Performance measures and a data set for multi-target, multi-camera tracking","venue":null,"work_id":"e511921a-26d6-4aa9-9b79-54171b703ebe","year":2016},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:36.300010Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:9645d99bc23694f5f1afe88298856918ff88bb2bbc328f525e22110707011c29","observation_id":"a2ad7b24-9803-44a6-8f01-9e7a52255402","resolution":{"observed_at":"2026-08-07T14:39:49.977423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:36.412598Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:36.412598Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:9af78252a6234a1e540a6d6c2dd0c1fa2ddcda19b14ebfeda74703e195dc9fd6","observation_id":"986d20ab-c7c7-4611-8eeb-ad05a8af723f","resolution":{"observed_at":"2026-08-07T14:39:36.412598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:49.735266Z","title":"Motion-i2v: Consistent and controllable image-to- video generation with explicit motion modeling","venue":null,"work_id":"ba206f71-8a11-45c3-99b8-a08ccc0dc0da","year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:36.511573Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:60f07c7b0f8cc6fc8a1a1e3512a601b50785a8284357d7503402a9ec7ba62073","observation_id":"f6261cbb-7924-47d6-87df-5d0653f45bff","resolution":{"observed_at":"2026-08-07T14:39:49.824616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-07T14:39:36.624194Z","title":"Make-a-video: Text-to-video generation without text-video data.arXiv preprint arXiv:2209.14792, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:36.624194Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:9d4ec99f9fe9d4ba63192407008d17dc6bd7e626ad90cc2092802b62e4746fe1","observation_id":"682b075f-1a07-4905-a8b1-4919e9eb09c4","resolution":{"observed_at":"2026-08-07T14:39:36.624194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14484","last_updated":"2025-09-08T04:39:24Z","snapshot_observed_at":"2026-08-08T02:33:17.377276Z","submitted_at":"2024-12-19T03:10:26Z","title":"Llama Learns to Direct: DirectorLLM for Human-Centric Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14484","snapshot_observed_at":"2026-08-07T14:39:36.773038Z","title":"Directorllm for human-centric video generation.arXiv preprint arXiv:2412.14484, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:36.773038Z"},"links":{"cited_paper":"/paper/2412.14484","citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:e0e3891720a0366c2dd91b23192c0e19c4fb7e7c0f7346780ce8a773c7e3a6e1","observation_id":"fe4084ab-4cf7-48a7-9c17-4e1a95b2bb29","resolution":{"observed_at":"2026-08-07T14:39:36.773038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:49.545842Z","title":"Transnet v2: An effective deep network architecture for fast shot transition detection","venue":null,"work_id":"cc94442c-7b8d-4b00-b54b-a24a1a62f3fc","year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:36.918213Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:dd746220d1b7c2d0c4fe3aea429f44df50bead36dbe0314ab341d422b63171c8","observation_id":"a735f50a-d9d7-44ff-984d-281da8418352","resolution":{"observed_at":"2026-08-07T14:39:49.631466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-08-07T21:50:52.094296Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-08-07T14:39:37.046057Z","title":"T2v-compbench: A comprehensive benchmark for compositional text-to-video generation.arXiv preprint arXiv:2407.14505, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:37.046057Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:0411103850b9a446f86c6878bb866164045ff1021ad5d6dd7877da848641651c","observation_id":"295ef70f-8597-41db-824d-ae06ac631d1a","resolution":{"observed_at":"2026-08-07T14:39:37.046057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:37.148856Z","title":"Journeydb: A benchmark for generative image understanding.Advances in neural information processing systems, 36:49659–49678, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:37.148856Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:1c84afdee86d6c1e89dfa4cae23c23cf8c5406bf958b951bebe15ace24b385e1","observation_id":"17dab6e0-1d7f-4180-93a1-3b9ef8666ec9","resolution":{"observed_at":"2026-08-07T14:39:37.148856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17423","last_updated":"2024-11-26T13:30:41Z","snapshot_observed_at":"2026-08-01T14:42:13.985788Z","submitted_at":"2024-11-26T13:30:41Z","title":"DRiVE: Diffusion-based Rigging Empowers Generation of Versatile and Expressive Characters","version":1},"cited_work":{"arxiv_id":"2411.17423","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.17423","snapshot_observed_at":"2026-08-07T14:39:43.941767Z","title":"DRiVE: Diffusion-based Rigging Empowers Generation of Versatile and Expressive Characters","venue":"cs.CV","work_id":"e453ac6c-832b-4347-a7de-9eae2336fddd","year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:37.284377Z"},"links":{"cited_paper":"/paper/2411.17423","citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:4bf8a894f2358023365372b2a2a2cc5a1f57225026be20d0f829546503af9b13","observation_id":"0ab2f963-912a-410f-b6ef-81fe8dfa4e11","resolution":{"observed_at":"2026-08-07T14:39:44.064186Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:49.329893Z","title":"Beyond talking–generating holistic 3d human dyadic motion for communication.International Journal of Computer Vision, 133(5):2910–2926, 2025","venue":null,"work_id":"a18eefbc-9a9d-4b39-bfda-01529c6665ba","year":2025},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:37.406670Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:1eff613ec48c25da6a0f6b07a9c84308afdf55b7c70bb44af9afcfa9c7a10771","observation_id":"a8539f1c-a8e2-4549-adf7-af82da83321e","resolution":{"observed_at":"2026-08-07T14:39:49.423338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:37.503517Z","title":"Video understanding with large language models: A survey.IEEE Transactions on Circuits and Systems for Video Technology, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:37.503517Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:bba4413b595e67310020dc5180677090e8ca7365d1b1d587c50dee819e160825","observation_id":"462060f9-a4b0-4549-9216-66fbc861a471","resolution":{"observed_at":"2026-08-07T14:39:37.503517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14916","last_updated":"2022-10-03T09:17:41Z","snapshot_observed_at":"2026-07-06T13:57:50.746457Z","submitted_at":"2022-09-29T16:27:53Z","title":"Human Motion Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14916","snapshot_observed_at":"2026-08-07T14:39:37.631482Z","title":"Human motion diffusion model.arXiv preprint arXiv:2209.14916, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:37.631482Z"},"links":{"cited_paper":"/paper/2209.14916","citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:0bbc811e9ba33bf7e9634451630becab573fa21f4e6478bbc249662f965d40de","observation_id":"49039b20-9780-4dcf-88f4-a11b31bd5e09","resolution":{"observed_at":"2026-08-07T14:39:37.631482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-07-06T20:22:50.018799Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10687","snapshot_observed_at":"2026-08-07T14:39:37.744863Z","title":"Emo2: End-effector guided audio-driven avatar video generation.arXiv preprint arXiv:2501.10687, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:37.744863Z"},"links":{"cited_paper":"/paper/2501.10687","citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:02e50db49d4e20ae499bf9fb18ded0d94325786b148f084337675953f605fc69","observation_id":"3db3c4ac-a43b-4926-b51d-162747b2aa91","resolution":{"observed_at":"2026-08-07T14:39:37.744863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17697","last_updated":"2024-11-27T07:39:20Z","snapshot_observed_at":"2026-08-06T12:03:20.133598Z","submitted_at":"2024-11-26T18:59:22Z","title":"StableAnimator: High-Quality Identity-Preserving Human Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17697","snapshot_observed_at":"2026-08-07T14:39:37.877008Z","title":"Stablean- imator: High-quality identity-preserving human image animation.arXiv preprint arXiv:2411.17697, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:37.877008Z"},"links":{"cited_paper":"/paper/2411.17697","citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:b155efe1430dc6fe49c9fbfbb6fdfabde912e497d952391e4e3e6304b0836a10","observation_id":"24dcd086-b1d8-49c5-b27f-026e69609a5c","resolution":{"observed_at":"2026-08-07T14:39:37.877008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:38.009818Z","title":"Fvd: A new metric for video generation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:38.009818Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:b086c8a4a7e404dad6b722c29c144e3b9cbd8d1dd7af98a4cf1caa1fd4fbc3d5","observation_id":"534ead77-e2ec-49f6-9f7f-096e10dc33a1","resolution":{"observed_at":"2026-08-07T14:39:38.009818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:49.047468Z","title":"Articulated mesh animation from multi-view silhouettes","venue":null,"work_id":"f82ad9f3-5c6a-42a0-9cfd-67a23cc20d78","year":2008},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:38.139105Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:b510dfedaa60d8474a881b6842f41fb626d7100b04e33051b18e1946d36e08a5","observation_id":"52b01249-347e-4aab-990a-adfe2027572e","resolution":{"observed_at":"2026-08-07T14:39:49.170717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05530","last_updated":"2025-05-18T04:20:01Z","snapshot_observed_at":"2026-07-06T18:42:43.011995Z","submitted_at":"2024-07-08T00:28:41Z","title":"This&That: Language-Gesture Controlled Video Generation for Robot Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05530","snapshot_observed_at":"2026-08-07T14:39:38.240073Z","title":"This&that: Language-gesture controlled video generation for robot planning.arXiv preprint arXiv:2407.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:38.240073Z"},"links":{"cited_paper":"/paper/2407.05530","citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:20827fa2881a7f5fc501b28bdd556efbf033ea0c4f2848184b9b75156962a68b","observation_id":"dfd18d8f-71fe-406c-b47d-1988373d0415","resolution":{"observed_at":"2026-08-07T14:39:38.240073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08850","last_updated":"2024-12-08T10:17:43Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T06:27:13Z","title":"COVE: Unleashing the Diffusion Feature Correspondence for Consistent Video Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08850","snapshot_observed_at":"2026-08-07T14:39:38.352118Z","title":"Cove: Unleashing the diffusion feature correspondence for consistent video editing.arXiv preprint arXiv:2406.08850, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:38.352118Z"},"links":{"cited_paper":"/paper/2406.08850","citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:700335d46800ff2d9e4c171be20f8bd65eb52f0e95876bfd7a21de073355a4a9","observation_id":"e9cfa681-e7ca-4641-be4d-fa5de2ea8ff4","resolution":{"observed_at":"2026-08-07T14:39:38.352118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04746","last_updated":"2025-06-13T02:29:47Z","snapshot_observed_at":"2026-08-07T03:44:44.446465Z","submitted_at":"2024-11-07T14:29:02Z","title":"Taming Rectified Flow for Inversion and Editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04746","snapshot_observed_at":"2026-08-07T14:39:38.465996Z","title":"Taming rectified flow for inversion and editing.arXiv preprint arXiv:2411.04746, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:38.465996Z"},"links":{"cited_paper":"/paper/2411.04746","citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:a35cec8ab8783ec61fd0dcba45dae0b6ed469eaee1ee10bf2bab203aeba38f35","observation_id":"e864da19-96b1-4111-ab4c-20661dfd5966","resolution":{"observed_at":"2026-08-07T14:39:38.465996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18156","last_updated":"2024-05-28T13:18:32Z","snapshot_observed_at":"2026-07-06T18:21:18.150567Z","submitted_at":"2024-05-28T13:18:32Z","title":"VividPose: Advancing Stable Video Diffusion for Realistic Human Image Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18156","snapshot_observed_at":"2026-08-07T14:39:38.608579Z","title":"Vividpose: Advancing stable video diffusion for realistic human image animation.arXiv preprint arXiv:2405.18156, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:38.608579Z"},"links":{"cited_paper":"/paper/2405.18156","citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:e52390b366506c29ce410f27dd4f73539e1d9b968f3d757258dce946ca29a315","observation_id":"565a5ffb-4f3d-4970-8bb6-9b8050c1f3fa","resolution":{"observed_at":"2026-08-07T14:39:38.608579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:48.835193Z","title":"Disco: Disentangled control for realistic human dance generation","venue":null,"work_id":"a891c7b5-0394-41ef-a0af-95550765f2aa","year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:38.726642Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:b54c8548576fc94e461cb64da4e4e3479ed38df4de93d3e7e0cc7219c146e9ec","observation_id":"6119652b-97ef-4568-b9a7-3cfbd9be9051","resolution":{"observed_at":"2026-08-07T14:39:48.943110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:48.588004Z","title":"Unianimate: Taming unified video diffusion models for consistent human image animation","venue":null,"work_id":"8cd68e21-844d-427c-bfe2-900dac073c32","year":2025},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:38.845741Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:d9df003028cacd3abaf8a6011a8b976d8702cbaacffba542c903b539e1929ddf","observation_id":"65f317fb-c8d2-4a1c-beca-ac1f96bba92e","resolution":{"observed_at":"2026-08-07T14:39:48.700278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:38.951240Z","title":"Unianimate-dit: Human image animation with large-scale video diffusion transformer.arXiv preprint arXiv:2504.11289, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:38.951240Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:b9172cebd704b9addaef3e022a2fa53695b4dd21cebc9a5286b067b5e2633c83","observation_id":"faf8ef46-0828-4759-a6f9-a773ad75e8d1","resolution":{"observed_at":"2026-08-07T14:39:38.951240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:48.402554Z","title":"Instructavatar: Text-guided emotion and motion control for avatar generation","venue":null,"work_id":"1e002b2a-32a7-4fce-81ee-9fe9d324a926","year":2025},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:39.037038Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:2120faec71551e84b2b02e130a84bdb8fa298ad9b7fb510ef0d8b20768479af4","observation_id":"c8bf9644-9762-4233-9e2e-7c962d2e1edb","resolution":{"observed_at":"2026-08-07T14:39:48.495127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:39.157902Z","title":"Bovik, H.R","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:39.157902Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:4cfbd515e3e24872625e6b6da1bb099fac043c7666f9969cb905c6a528b72cab","observation_id":"e6bc5f26-51b7-48df-8410-96fa349b471d","resolution":{"observed_at":"2026-08-07T14:39:39.157902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:48.185799Z","title":"Humanvid: Demystifying training data for camera-controllable human image animation","venue":null,"work_id":"4592b7d6-f6a8-4166-b533-0697e76b2e87","year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:39.307743Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:f52c092365996bca7eb18894511d7c7dd8d6237753e502e99f8a8809d9eb0210","observation_id":"3ece665e-7fe3-49eb-9d56-486174428730","resolution":{"observed_at":"2026-08-07T14:39:48.285878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:39.404847Z","title":"Multi- identity human image animation with structural video diffusion.arXiv preprint arXiv:2504.04126, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:39.404847Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:8d88c21bf70a5023504bf494e1885dca47b1f6f439459808a1224afb62665572","observation_id":"a2ee6168-693d-40cb-8685-840a0cec5c10","resolution":{"observed_at":"2026-08-07T14:39:39.404847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03641","last_updated":"2024-07-16T17:27:10Z","snapshot_observed_at":"2026-07-06T16:57:51.263433Z","submitted_at":"2023-12-06T17:49:57Z","title":"MotionCtrl: A Unified and Flexible Motion Controller for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03641","snapshot_observed_at":"2026-08-07T14:39:39.527828Z","title":"Mo- tionctrl: A unified and flexible motion controller for video generation.arXiv preprint arXiv:2312.03641, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:39.527828Z"},"links":{"cited_paper":"/paper/2312.03641","citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:d56da2d6317362a72afe7f267cd73e33df19fca0913c5ee305f1dce8bd7a3436","observation_id":"4a53d9b5-b2d4-4d2c-80f0-ecc04d5e0eda","resolution":{"observed_at":"2026-08-07T14:39:39.527828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:39.651709Z","title":"Easyanimate: A high-performance long video generation method based on transformer architecture.arXiv preprint arXiv:2405.18991, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:39.651709Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:2a962f60da663c2d696bdbb4901754e49cb33a6a8f56807ce1fa73b0d17deb1c","observation_id":"02e6b24b-ea57-4867-9607-8d45d5c52528","resolution":{"observed_at":"2026-08-07T14:39:39.651709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:47.947893Z","title":"Xagen: 3d expressive human avatars generation.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"d7858b4f-5207-4956-8725-abdb51d022b1","year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:39.799853Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:65413fb5113d4fb1865d04d824f5c637bc936945fa19d948faad1fdbb133956c","observation_id":"547a547b-feb7-4de0-a803-018f84f6dd5f","resolution":{"observed_at":"2026-08-07T14:39:48.028384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:47.776707Z","title":"Magicanimate: Temporally consistent human image animation using diffusion model","venue":null,"work_id":"8a267789-8cf1-4a9e-9933-ef2fa01da29f","year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:39.935004Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:0be63aefb4bfb764bf0fffc56b03ddbe683f4b331b75d737a67a44ecd71f988d","observation_id":"85fc7bfc-08dc-4b08-9ab8-cd81ff7f3f8f","resolution":{"observed_at":"2026-08-07T14:39:47.844906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:40.070249Z","title":"Magicanimate: Temporally consistent human image animation using diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:40.070249Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:a02d8ab7c4cb7429ed26c045600a1bc6ed6d0a76aa683bd05d5d0a5657c8338a","observation_id":"af62cdba-6000-43af-b74d-f697c5675f72","resolution":{"observed_at":"2026-08-07T14:39:40.070249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:47.577213Z","title":"Human motion video generation: A survey.Authorea Preprints, 2024","venue":null,"work_id":"9bdd9719-0d21-472f-8de0-defe66c1a135","year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:40.182270Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:eb6d3f51dafad21c43e1cfae071dca22e446b617b280bd7fcc204b72a763d3a8","observation_id":"50f1e59c-f42d-4244-90e8-cc3913e8dec7","resolution":{"observed_at":"2026-08-07T14:39:47.723646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03035","last_updated":"2025-03-01T09:24:04Z","snapshot_observed_at":"2026-07-06T18:25:44.620682Z","submitted_at":"2024-06-05T08:03:18Z","title":"Towards Multiple Character Image Animation Through Enhancing Implicit Decoupling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03035","snapshot_observed_at":"2026-08-07T14:39:40.295999Z","title":"Follow-your-pose v2: Multiple-condition guided character image animation for stable pose control.arXiv preprint arXiv:2406.03035, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:40.295999Z"},"links":{"cited_paper":"/paper/2406.03035","citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:d1a1f68ecb969df7f65723677595f4bc287139d0d77e1d61f19ff12b2efe8754","observation_id":"2a91e9a4-748e-4ad8-b9f0-f62fe7a174fb","resolution":{"observed_at":"2026-08-07T14:39:40.295999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:47.360506Z","title":"Video quality assessment via gradient magnitude similarity deviation of spatial and spatiotemporal slices","venue":null,"work_id":"80335364-0362-444f-aa44-ebde883c1955","year":2015},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:40.471781Z"},"links":{"citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:d8cf5b98505f844c6d33bfea623ac4c5abf8b4ff68478aeb11e72d8a9a8681dc","observation_id":"6c5edda7-7994-4a5f-aa32-a100e15d477b","resolution":{"observed_at":"2026-08-07T14:39:47.474740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":81,"verified_exact":2,"verified_fuzzy":17},"total_outbound_references":122},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 100 of 122 outbound references and 4 inbound Pith citation observations for arXiv:2505.18078."}