{"as_of":"2026-08-11T05:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d8fc901d679d3ff55f0a13886c7d5c0efd487197a6a2bfa2a7c13145034035a6","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T06:35:58.943585Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:56:38.890556Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-10T21:56:39.169130Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"cited_work":{"arxiv_id":"2606.30019","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.30019","snapshot_observed_at":"2026-08-10T21:56:39.169130Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","venue":"cs.CV","work_id":"24432fa9-f00e-4a9a-ae03-9c16b845c98a","year":2026},"citing_paper":{"arxiv_id":"2608.06722","last_updated":"2026-08-07T02:32:11Z","snapshot_observed_at":"2026-08-11T05:11:12.276144Z","submitted_at":"2026-08-07T02:32:11Z","title":"CustomDance: Customized 3D Dance Generation with Coarse-to-Fine Human-Centered Interactive Control","version":1},"reference_index":183,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:38.890556Z"},"links":{"cited_paper":"/paper/2606.30019","citing_paper":"/paper/2608.06722"},"observation_digest":"sha256:b0bdb5b27080c59618a10bc01e15709d62348edf571ba5e75025b3b7c82a46f8","observation_id":"10f311db-ad8e-4490-b2b5-def2795d3680","resolution":{"observed_at":"2026-08-10T21:56:39.174009Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.30019/citation-record","integrity":"/paper/2606.30019/integrity","json":"/paper/2606.30019/citation-record.json","paper":"/paper/2606.30019"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:35:58.943585Z","title":"Advances in neural information processing systems33, 12449–12460 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:3ac4cd33b4bfcfa8a388ff2744e72e8d13119e64364a4b6586a17a46b869318f","observation_id":"fb29175d-224d-4d17-b4e7-d46cf62b94b4","resolution":{"observed_at":"2026-06-30T06:35:58.943585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:e68d9f2798d540d51ac1fdba8d4e93ec96c6405b4bce5e653349788022b9f7be","observation_id":"cec59a99-4354-443d-830b-adac9e60741f","resolution":{"observed_at":"2026-06-30T06:44:19.529859Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:35:58.943585Z","title":"Research in dance education5(1), 45–67 (2004)","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:cb70147a3a663ab95eb9f9a5f76c0ba5f00cd22b3cb94f3e62f9e99bae5ba91a","observation_id":"b3398268-c23d-475b-b9d6-fc44c7a75eb5","resolution":{"observed_at":"2026-06-30T06:35:58.943585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:35:58.943585Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:1f01299ce0f01c9ad11d29cd8f01daf2d9148f52fa3062f8599c149d24e43ba0","observation_id":"aea1df7f-69df-4357-ab2b-7b4f1813301b","resolution":{"observed_at":"2026-06-30T06:35:58.943585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.12880","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:44:19.533879Z","title":"S2-guidance: Stochastic self guidance for training-free enhancement of diffusion models","venue":null,"work_id":"23671066-7c01-4a16-8fe6-794f4e803fb7","year":2025},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:efc700b3074cea0e226728c1445015589e44b22b8d9ed802053dd6e57a07379c","observation_id":"4d585d65-17f0-4597-b1eb-a485fee114bc","resolution":{"observed_at":"2026-06-30T06:44:19.535561Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:35:58.943585Z","title":"In: Proceedings of the 33rd ACM International Conference on Multimedia","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:ed75111ecbd3448ba095bc82d7a6e4b2aa6727cc863827492006d13879fcad1c","observation_id":"faf59904-f197-4b7b-9d95-45502121f931","resolution":{"observed_at":"2026-06-30T06:35:58.943585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17414","last_updated":"2025-07-11T17:58:23Z","snapshot_observed_at":"2026-08-10T15:44:25.012883Z","submitted_at":"2025-02-24T18:47:54Z","title":"X-Dancer: Expressive Music to Human Dance Video Generation","version":2},"cited_work":{"arxiv_id":"2502.17414","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.17414","snapshot_observed_at":"2026-06-30T06:44:19.531095Z","title":"X-dancer: Expressive music to human dance video generation","venue":null,"work_id":"2bde1475-c2c3-43ee-b24e-167416f2fe31","year":2025},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"cited_paper":"/paper/2502.17414","citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:68adda5fb54807399dfafdd76f1195a0a9a2f12163d0c8c53333b56e65a5252f","observation_id":"b2e2595e-84e5-4a17-8626-3a3b7be593d0","resolution":{"observed_at":"2026-06-30T06:44:19.532612Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.14055","doi":"10.48550/arxiv.2509.14055","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan-animate: Unified character animation and replacement with holistic replication","venue":"ArXiv.org","work_id":"1c15dac3-bc1f-40d5-bdd2-f3fce19a9f76","year":2025},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:79358cfed075db288a74249549ab4cf542de626e3f3f48e47c26367d8521e268","observation_id":"5ee37d0f-3c03-4f4b-aa38-0f8ad40fec93","resolution":{"observed_at":"2026-06-30T06:44:19.593277Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:18.520087+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:18.520087+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-10T18:21:21.165877Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2410.07718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-07-01T21:46:15.594455Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","venue":null,"work_id":"a36f46e1-e536-4499-b2bc-ed760196c9cf","year":2024},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:e4e6b6e6aa3fd3ba66d47846d4a296d198e90aff46915e464dbae61aa1444eef","observation_id":"5ebf10fb-1614-4105-a973-0a5927c1d4d1","resolution":{"observed_at":"2026-06-30T06:44:19.601000Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18801","last_updated":"2025-01-30T23:38:51Z","snapshot_observed_at":"2026-08-09T22:22:39.817428Z","submitted_at":"2025-01-30T23:38:51Z","title":"Every Image Listens, Every Image Dances: Music-Driven Image Animation","version":1},"cited_work":{"arxiv_id":"2501.18801","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18801","snapshot_observed_at":"2026-06-30T06:44:19.594321Z","title":"arXiv preprint arXiv:2501.18801 (2025)","venue":null,"work_id":"21f260a6-42cd-4a38-bf0d-a15ae8a32e14","year":2025},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"cited_paper":"/paper/2501.18801","citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:e77563d000df696d4ac8824a34c66a3afeadd211b746fc5e36fedf96e0bcb1a0","observation_id":"537450f4-7773-4ca5-9e7e-60f73dd4a0c7","resolution":{"observed_at":"2026-06-30T06:44:19.595868Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:35:58.943585Z","title":"arXiv e-prints pp","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:c1d5e12178fdb1d1ab84fc0827c5c3333d0dd8ea4024bbcde3c83dad1cbb45c9","observation_id":"ca9252b4-dc6f-42cf-900f-75e4ef0fbfe5","resolution":{"observed_at":"2026-06-30T06:35:58.943585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:38a3017f6645cf829a27618473e1b4ff65a9b4c222f31fe456e6520a7c0081be","observation_id":"9adfd245-c7ea-4461-bb45-c772ba35572c","resolution":{"observed_at":"2026-06-30T06:44:19.552832Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:35:58.943585Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:1a77eeb450679cee6908c7ccdb277e66efdb9ac7893ff2b01282347d7154c661","observation_id":"1b3857d2-8867-4ae9-8345-1a529d016730","resolution":{"observed_at":"2026-06-30T06:35:58.943585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:35:58.943585Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:b414f7aa644261604e737b15dd5433f25216a2402fa0b42080c6b68a74438c89","observation_id":"c0eba194-2e45-4c1e-a916-67bf25a4946d","resolution":{"observed_at":"2026-06-30T06:35:58.943585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:35:58.943585Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:2c0a9f9c277d90aa9bdff039437cfd7de6cb6c61e2221a7379d7739c2211ec87","observation_id":"b616fbd8-c799-434e-8aa7-f733921db964","resolution":{"observed_at":"2026-06-30T06:35:58.943585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.15803","last_updated":"2026-05-15T09:56:40Z","snapshot_observed_at":"2026-07-06T23:27:01.213106Z","submitted_at":"2026-05-15T09:56:40Z","title":"Embedding-perturbed Exploration Preference Optimization for Flow Models","version":1},"cited_work":{"arxiv_id":"2605.15803","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.15803","snapshot_observed_at":"2026-06-30T06:44:19.544026Z","title":"Embedding-perturbed Exploration Preference Optimization for Flow Models","venue":"cs.CV","work_id":"c7123c5b-b281-4959-8c68-8d927ae3fa6b","year":2026},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"cited_paper":"/paper/2605.15803","citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:5a03159565adafe84f545a6c85d737750824c5a082a9188b7ab0287917276236","observation_id":"13483ef0-0db2-47ea-b2cd-4de421249db2","resolution":{"observed_at":"2026-06-30T06:44:19.545925Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.04395","last_updated":"2026-04-23T03:50:19Z","snapshot_observed_at":"2026-07-06T22:53:24.585766Z","submitted_at":"2026-04-06T03:49:36Z","title":"BiTDiff: Fine-Grained 3D Conducting Motion Generation via BiMamba-Transformer Diffusion","version":2},"cited_work":{"arxiv_id":"2604.04395","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.04395","snapshot_observed_at":"2026-06-30T06:44:19.537068Z","title":"BiTDiff: Fine-Grained 3D Conducting Motion Generation via BiMamba-Transformer Diffusion","venue":"cs.CV","work_id":"a9ee93ec-eb85-4bed-a5a3-25e6989d84c3","year":2026},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"cited_paper":"/paper/2604.04395","citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:d04cb6220961ef1c02629954f998108ab8c2771a40d648b4778c26f77cfca3fd","observation_id":"3c6fdcda-7085-438a-948d-f0ea58c5ccb7","resolution":{"observed_at":"2026-06-30T06:44:19.538566Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:9d86da102a42625e0fe421a3d10b94da8daec96bf7ad7a6c1ca2c77b47faf133","observation_id":"acabdc1a-0e24-4127-9f03-7377d269ad7f","resolution":{"observed_at":"2026-06-30T06:44:19.590542Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.12586","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:44:19.591719Z","title":"Advancing end- to-end pixel space generative modeling via self-supervised pre-training","venue":null,"work_id":"4f90755f-f431-4408-8d8f-53fbe51ca8fb","year":2025},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:491f860a7fae55e826adac9b042115d3a4f0fe2e8079891ad677ad1759285510","observation_id":"6ca465d5-d78c-4d55-a688-7e8668ac2224","resolution":{"observed_at":"2026-06-30T06:44:19.593170Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:35:58.943585Z","title":"In: Pro- ceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:cb3cbe61b41aa9d0bbf2f6a8264e4586c913c01c34d548b9642ce36ce06580b3","observation_id":"e6a18abb-780f-4a2e-8bc1-5c24bf8a89f7","resolution":{"observed_at":"2026-06-30T06:35:58.943585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:35:58.943585Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:fd0aad13df4425a6d4321045197a535b0da6163c80a0ec23d7564f563a48d2ff","observation_id":"4d5eddc3-04cb-4721-b8a6-9166736f7298","resolution":{"observed_at":"2026-06-30T06:35:58.943585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:35:58.943585Z","title":"In: Proceed- ings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:dbcb6d75acd97d6795177596cc90e271e92828d10d0dbefded47ed30c72b9b2a","observation_id":"e235e9e1-2761-458a-b136-ad75cd7cb85e","resolution":{"observed_at":"2026-06-30T06:35:58.943585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:35:58.943585Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:3128fed736c061ad0478cfba460bc401d6008392d2bfb5fdda841d1df6faae48","observation_id":"10c36f28-a410-4207-98cc-93cc017ddc00","resolution":{"observed_at":"2026-06-30T06:35:58.943585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:35:58.943585Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:ed1d3e370427d251df92583a1fbf2ace8a07d7f269f4ba777f17b3321a757e95","observation_id":"c2d458ee-31b4-45cb-bafd-f196fcd71be2","resolution":{"observed_at":"2026-06-30T06:35:58.943585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.03905","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:09:44.554460Z","title":"Fabian Mentzer, David Minnen, Eirikur Agustsson, and Michael Tschannen","venue":null,"work_id":"efe5ba88-2aef-4f2a-b059-e94a549778fb","year":2025},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:fb1214e2d528fd70f70b5236f812c941040a8d9081c4cbf83564af78efd603bf","observation_id":"c09a2322-f605-44db-b98e-1fd8e86057a2","resolution":{"observed_at":"2026-06-30T06:44:19.590535Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:35:58.943585Z","title":"In: Proceedings of the 33rd ACM International Conference on Multimedia","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:e05b15845f702f2ec42645b58e749c13364281ed53709c7f28a1c55f3360680a","observation_id":"e61620c7-8023-4179-b0fa-3b1c255f09f1","resolution":{"observed_at":"2026-06-30T06:35:58.943585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.19546","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:44:19.580499Z","title":"Actavatar: Temporally-aware precise action control for talking avatars","venue":null,"work_id":"94291b48-16b0-43a6-a1d7-f88b558a964a","year":2025},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:72b97b2f2affa792a3350d770f148de5dd43541eed23aa5cef3852ac4f05c1f2","observation_id":"5e8eacf5-bcf1-4883-a694-d06b16806965","resolution":{"observed_at":"2026-06-30T06:44:19.582124Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14742","last_updated":"2025-06-17T17:22:12Z","snapshot_observed_at":"2026-08-10T23:13:38.214556Z","submitted_at":"2025-06-17T17:22:12Z","title":"SyncTalk++: High-Fidelity and Efficient Synchronized Talking Heads Synthesis Using Gaussian Splatting","version":1},"cited_work":{"arxiv_id":"2506.14742","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14742","snapshot_observed_at":"2026-06-30T06:44:19.567553Z","title":"arXiv preprint arXiv:2506.14742 (2025)","venue":null,"work_id":"5992ee66-e8ec-4874-bceb-0064279ae7e8","year":2025},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"cited_paper":"/paper/2506.14742","citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:9cf6338a3bf462e2afdfb0f27248b2089e84daf7e6515acd02ba4600bf1948e7","observation_id":"3df4f41a-c2c8-470a-8c75-5617e593f6e3","resolution":{"observed_at":"2026-06-30T06:44:19.569204Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:35:58.943585Z","title":"In: Pro- ceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recogni- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:2c06c1774b02102914a6c4dc01d3b4be22dea2a847d0db347ebf26b79ce9c9d7","observation_id":"530c4fbe-d9f6-4e53-829f-0ec100ed2d5c","resolution":{"observed_at":"2026-06-30T06:35:58.943585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.21448","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:41:04.366336Z","title":"Omnisync: Towards universal lip synchronization via diffusion transformers.arXiv preprint arXiv:2505.21448","venue":null,"work_id":"b5489534-2ce4-4272-83e1-683f8106e40c","year":2025},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:89bd2fd8d85eeadb9ff19f5f9691a5dc5fc095651a1f3db3bc9cd234b3115f33","observation_id":"ae4237e7-65b1-443d-aa68-b410d850dda8","resolution":{"observed_at":"2026-06-30T06:44:19.567409Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:35:58.943585Z","title":"In: Proceed- ings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:5969cd1b701ca7517fdc10dff8be4f7c98484fbda7270e3db166c3407fb29632","observation_id":"82ad42c7-138b-4a30-9e7b-192ed30b68dc","resolution":{"observed_at":"2026-06-30T06:35:58.943585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10306","last_updated":"2024-12-11T02:55:31Z","snapshot_observed_at":"2026-08-07T06:22:46.243818Z","submitted_at":"2024-10-14T09:06:55Z","title":"Animate-X: Universal Character Image Animation with Enhanced Motion Representation","version":2},"cited_work":{"arxiv_id":"2410.10306","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10306","snapshot_observed_at":"2026-07-02T20:37:22.296222Z","title":"Animate-x: Universal character image ani- mation with enhanced motion representation","venue":null,"work_id":"daec75ab-954d-4189-a3ac-fcf21c8e967a","year":2024},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"cited_paper":"/paper/2410.10306","citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:bf77d4073ec130bec4c8393b2b93935ad7aeb82e279147365d4c0a6987a07775","observation_id":"6a14fdc0-8ee0-4113-9031-c97ef403c0ce","resolution":{"observed_at":"2026-06-30T06:44:19.575024Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:35:58.943585Z","title":"IEEE transactions on pattern anal- ysis and machine intelligence (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:699ff47031584d5381736a3e7a1b9bceb56ca250fc59db180f44ced617241184","observation_id":"f0a1d500-ebbb-4847-bf4f-b1d3e5f0efbb","resolution":{"observed_at":"2026-06-30T06:35:58.943585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:35:58.943585Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:918f619b4fe345f7657ad83abb78762951dd98ae0c52742be154e0bba6ef3987","observation_id":"aab00926-53fe-4e2e-9c6a-9b73b826ae55","resolution":{"observed_at":"2026-06-30T06:35:58.943585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:ec01f58dba761b20c50f3860ba4008973cf480a0e776f5dd9619d019d71661a8","observation_id":"e4c21596-8c67-4ad1-8b0b-407e8f995e44","resolution":{"observed_at":"2026-06-30T06:44:19.579198Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:35:58.943585Z","title":"In: Proceedings of the 33rd ACM International Conference on Multimedia","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:4f1f4bd1df1feb13587db52285a7c62145e7b1c6488f399c607265a7bc20b9c3","observation_id":"d2047bf4-6302-49af-b488-151239b220f0","resolution":{"observed_at":"2026-06-30T06:35:58.943585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:35:58.943585Z","title":"In: 2025 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:1e686b76eefddaf4a8b586cb48a5ae07d03cd3126637223d9490c2547eef61c6","observation_id":"bafd5b30-26e5-4a00-aa8c-a3be24e4f62a","resolution":{"observed_at":"2026-06-30T06:35:58.943585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:35:58.943585Z","title":"Advances in neural information processing systems35, 38571–38584 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:ac5a4b49552b276e900ac45469a2040bf2e9eec24ecbff7c4ca79f3b60ce41e8","observation_id":"f4cf1850-3f6e-4340-97ae-650c5deb9aad","resolution":{"observed_at":"2026-06-30T06:35:58.943585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:35:58.943585Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:c43279f2191cde8e5a9028171107e795a8ec04f7f02f12b184dc9f1ce84fa8d0","observation_id":"a65de67a-8550-4bb1-a29b-b437461ed367","resolution":{"observed_at":"2026-06-30T06:35:58.943585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:35:58.943585Z","title":"In: Proceedings of the 2024 International Conference on Multimedia Retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:f728b613f24e9e980de5617e5afe45b8502b17bf09ed560a67b63ce1293cf07a","observation_id":"3897b3bc-81b4-46ae-aa88-3b2384427b16","resolution":{"observed_at":"2026-06-30T06:35:58.943585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.14222","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:44:19.597028Z","title":"arXiv preprint arXiv:2505.14222 (2025)","venue":null,"work_id":"c475b7a7-a730-4150-ba94-692431b9e20b","year":2025},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:3882e30c4fa4f6caa4e6d1c30d801fc9b34326d27792a96ff1a6b2c391dfd51a","observation_id":"88c8b0b4-89ee-41c3-be12-3a1a250e8514","resolution":{"observed_at":"2026-06-30T06:44:19.598486Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.17543","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:44:19.568573Z","title":"Megadance: Mixture-of-experts architecture for genre-aware 3d dance generation","venue":null,"work_id":"ff68a592-0c27-4afe-bc9e-9c481b5848bd","year":2025},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:850b1b4a7454251a24ab5aa0f839962d3a568f8c9d2bae2d52325722f06a385d","observation_id":"e0c73816-4860-44fe-91db-b9ee0dcafcba","resolution":{"observed_at":"2026-06-30T06:44:19.570081Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21029","last_updated":"2026-06-22T20:04:30Z","snapshot_observed_at":"2026-08-06T10:26:20.620397Z","submitted_at":"2025-11-26T03:53:10Z","title":"FlowerDance: MeanFlow for Efficient and Refined 3D Dance Generation","version":3},"cited_work":{"arxiv_id":"2511.21029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.21029","snapshot_observed_at":"2026-06-30T06:44:19.571333Z","title":"Flow- erdance: Meanflow for efficient and refined 3d dance generation","venue":"cs.CV","work_id":"d0f4851c-893e-4fa9-bf1b-c03f4622e7ca","year":2025},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"cited_paper":"/paper/2511.21029","citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:d71f89a0606263469a796a906e0c9d87c96c342fdda6dbcd12b741d9a747e50c","observation_id":"b88d2220-8914-472e-9c46-7cf97c25f02e","resolution":{"observed_at":"2026-06-30T06:44:19.572992Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19123","last_updated":"2024-12-26T08:47:13Z","snapshot_observed_at":"2026-08-11T00:53:15.765895Z","submitted_at":"2024-12-26T08:47:13Z","title":"CoheDancers: Enhancing Interactive Group Dance Generation through Music-Driven Coherence Decomposition","version":1},"cited_work":{"arxiv_id":"2412.19123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.19123","snapshot_observed_at":"2026-06-30T06:44:19.586454Z","title":"arXiv preprint arXiv:2412.19123 (2024)","venue":null,"work_id":"7f49e3cb-98d2-439e-8a55-e6402d6d460d","year":2024},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"cited_paper":"/paper/2412.19123","citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:a186aca5708e339bdf62bc4e88627ce91ff666ef110e024715fba2ec1092291b","observation_id":"054085dc-d6cd-4804-b988-a09edfb58e89","resolution":{"observed_at":"2026-06-30T06:44:19.587989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:35:58.943585Z","title":"In: Proceedings of the 2024 International Conference on Multimedia Retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:306dfc241c471ff996c765882ca45bdaf27b1571ba979da44fb2c731c0e03cc3","observation_id":"b780cdb1-3eff-439a-b698-47d47322f76f","resolution":{"observed_at":"2026-06-30T06:35:58.943585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.18181","last_updated":"2026-05-07T04:12:26Z","snapshot_observed_at":"2026-07-06T22:39:38.760525Z","submitted_at":"2025-12-20T02:34:34Z","title":"MACE-Dance: Motion-Appearance Cascaded Experts for Music-Driven Dance Video Generation","version":3},"cited_work":{"arxiv_id":"2512.18181","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.18181","snapshot_observed_at":"2026-06-30T06:44:19.583293Z","title":"MACE-Dance: Motion-Appearance Cascaded Experts for Music-Driven Dance Video Generation","venue":"cs.CV","work_id":"61e15a8e-0e74-4d7a-a3d9-6164252817c9","year":2025},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"cited_paper":"/paper/2512.18181","citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:7b6027aa0b8087f1fc61a475afa2e46a6c17f50cefba3e7dbd331054b702b305","observation_id":"94840277-1480-4a56-a4a0-61a496df2972","resolution":{"observed_at":"2026-06-30T06:44:19.584761Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":"2408.06072","doi":"10.48550/arxiv.2408.06072","metadata_source":"pith","pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","venue":"cs.CV","work_id":"f38fc088-12aa-4bf4-9ecd-08d3e797ccb7","year":2024},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:da8d4dca052c51e85c80e2dc89425cc8e36ae07de2959688c3e78b7a4af5c7b6","observation_id":"c9176e05-c955-477e-9046-2bc0f7cc23ed","resolution":{"observed_at":"2026-06-30T06:44:19.548879Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:35:58.943585Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:4a4c7abb24e1321c2b6b7759bcc592c52436160f0f7785028ff09922ecb58667","observation_id":"243a0096-7445-4d0f-a591-cb69979ae990","resolution":{"observed_at":"2026-06-30T06:35:58.943585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06064","last_updated":"2026-07-24T02:23:21Z","snapshot_observed_at":"2026-08-05T18:10:05.414470Z","submitted_at":"2026-05-07T11:48:39Z","title":"PersonaGesture: Single-Reference Co-Speech Gesture Personalization for Unseen Speakers","version":3},"cited_work":{"arxiv_id":"2605.06064","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.06064","snapshot_observed_at":"2026-06-30T06:44:19.555823Z","title":"PersonaGesture: Single-Reference Co-Speech Gesture Personalization for Unseen Speakers","venue":"cs.CV","work_id":"bbe2abdc-ab8f-40c2-9694-abab8efe8998","year":2026},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"cited_paper":"/paper/2605.06064","citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:7805d2ff891af518c0faaf257e47ac4dbdf395ebe92d750a0b9e1004e4c151f0","observation_id":"b9ea1eee-bf59-4a9b-8fae-56a8e245e1d0","resolution":{"observed_at":"2026-06-30T06:44:19.557202Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:35:58.943585Z","title":"IEEE Transactions on Circuits and Systems for Video Technology (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:98f754f06fcf9e10b5adae75408b01499e045358b658ed2b4296157725203063","observation_id":"a3a4c47e-be1f-4661-8a87-8400936e012e","resolution":{"observed_at":"2026-06-30T06:35:58.943585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:35:58.943585Z","title":"In: Pro- ceedings of the AAAIConference on Artificial Intelligence.vol","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:71d24c56c85791bb5db90153e29f10133a3eee1aa7b696f5647bd3ab3f508451","observation_id":"aa8fff30-f7c1-48c1-b083-d9e295354f17","resolution":{"observed_at":"2026-06-30T06:35:58.943585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:35:58.943585Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:75d16286c1db2e4a52dd21ab842330789ca06dfc5de3270f7c06d79d37ee0e43","observation_id":"778a839c-976a-4827-ac35-1ed536ee7f3c","resolution":{"observed_at":"2026-06-30T06:35:58.943585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:35:58.943585Z","title":"In: Pro- ceedings of the 33rd ACM International Conference on Multimedia","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:0aa628a89c80f0bcaa99b1156d1073c72dd7044eaeea88f9c1e32eee373ded5c","observation_id":"4cbcc49b-b0f2-4791-b0f7-01bc681d8761","resolution":{"observed_at":"2026-06-30T06:35:58.943585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.29655","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:44:19.561442Z","title":"arXiv preprint arXiv:2603.29655 (2026)","venue":null,"work_id":"3174c883-3152-4464-bca8-4b56d669473a","year":2026},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:a7e2a854dd9295465c7c9932c9612c664cebe10bb433a5c27be0662d2af3cd23","observation_id":"c1dd9b0e-9d6d-49e9-ae2c-42422452bc8e","resolution":{"observed_at":"2026-06-30T06:44:19.563070Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":15,"parse_uncertain":0,"unresolved":29,"verified_exact":10,"verified_fuzzy":0},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 1 inbound Pith citation observation for arXiv:2606.30019."}