{"as_of":"2026-08-11T01:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1fdaf0bc65ec0b66f3f5ac83425c814f971823bfdcd82d9046a9b714f0dd7030","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T19:07:45.221095Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T16:47:13.040011Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T15:08:24.974505Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10687","snapshot_observed_at":"2026-08-09T16:47:13.040011Z","title":"Emo2: End-effector guided audio-driven avatar video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.01061","last_updated":"2025-06-30T08:26:56Z","snapshot_observed_at":"2026-08-10T13:26:51.589421Z","submitted_at":"2025-02-03T05:17:32Z","title":"OmniHuman-1: Rethinking the Scaling-Up of One-Stage Conditioned Human Animation Models","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-09T16:47:13.040011Z"},"links":{"cited_paper":"/paper/2501.10687","citing_paper":"/paper/2502.01061"},"observation_digest":"sha256:f44f6f63dd18b2697e2bfbf2ae9fbd93ffc5d2eee65935aee48781edff29f6ea","observation_id":"5afc09ef-6566-4fdd-991a-13e24d1e0f52","resolution":{"observed_at":"2026-08-09T16:47:13.040011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10687","snapshot_observed_at":"2026-08-07T14:39:37.744863Z","title":"Emo2: End-effector guided audio-driven avatar video generation.arXiv preprint arXiv:2501.10687, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-09T20:53:30.709190Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:37.744863Z"},"links":{"cited_paper":"/paper/2501.10687","citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:0b01a1755d90684ef305ef35e7d37527cd789e4756449015f03432da00888384","observation_id":"3db3c4ac-a43b-4926-b51d-162747b2aa91","resolution":{"observed_at":"2026-08-07T14:39:37.744863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10687","snapshot_observed_at":"2026-08-07T13:07:32.372279Z","title":"Emo2: End-effector guided audio-driven avatar video generation.arXiv preprint arXiv:2501.10687, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:32.372279Z"},"links":{"cited_paper":"/paper/2501.10687","citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:d7966adb6174d3ced7bb8824cebeb64c1433eeb188b104a8b22bd9181fbfb3d7","observation_id":"f2aa37e3-d4ee-4e5b-8ad2-d4f0164a6dd9","resolution":{"observed_at":"2026-08-07T13:07:32.372279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10687","snapshot_observed_at":"2026-08-07T04:55:28.850843Z","title":"Emo2: End-effector guided audio-driven avatar video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.850843Z"},"links":{"cited_paper":"/paper/2501.10687","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:94e764e1c3a6fb1acfb5aca3c0f9283efb886806c1864ba22e306999e83b90fb","observation_id":"71ee290a-41c2-40a6-a35c-52be9b948044","resolution":{"observed_at":"2026-08-07T04:55:28.850843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10687","snapshot_observed_at":"2026-08-06T20:23:39.085973Z","title":"Emo2: End-effector guided audio- driven avatar video generation.arXiv preprint arXiv:2501.10687, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03256","last_updated":"2025-08-08T12:58:08Z","snapshot_observed_at":"2026-08-08T02:15:29.534181Z","submitted_at":"2025-07-04T02:25:10Z","title":"MoDA: Multi-modal Diffusion Architecture for Talking Head Generation","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:39.085973Z"},"links":{"cited_paper":"/paper/2501.10687","citing_paper":"/paper/2507.03256"},"observation_digest":"sha256:4c4646bd7ab44fb7daf83d1ccdfd3f1cf319bf6a80ea3984ce61c93798bcde34","observation_id":"6edac27d-81d2-4a35-8790-f58beb70f529","resolution":{"observed_at":"2026-08-06T20:23:39.085973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10687","snapshot_observed_at":"2026-08-05T18:50:16.273895Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-05T18:50:15.388089Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T18:50:16.273895Z"},"links":{"cited_paper":"/paper/2501.10687","citing_paper":"/paper/2508.14033"},"observation_digest":"sha256:177b7d0372cd50f62b2559811ae0d86b2798b9c91d556d71fd86d1a0afe9ee07","observation_id":"66570f13-5e7a-4442-9bca-2b84f46e50b1","resolution":{"observed_at":"2026-08-05T18:50:16.273895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10687","snapshot_observed_at":"2026-08-05T16:24:59.025790Z","title":"Emo2: End-effector guided audio- driven avatar video generation, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T16:24:59.025790Z"},"links":{"cited_paper":"/paper/2501.10687","citing_paper":"/paper/2508.18621"},"observation_digest":"sha256:70aea67e6893823592ab73545b8fc193a9f712888e2fd2eba84384465b8f577d","observation_id":"6897fdfb-9ade-43ff-a776-5b1078b0f010","resolution":{"observed_at":"2026-08-05T16:24:59.025790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10687","snapshot_observed_at":"2026-08-05T16:01:30.783917Z","title":"Emo2: End-effector guided audio- driven avatar video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-09T02:00:04.850473Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.783917Z"},"links":{"cited_paper":"/paper/2501.10687","citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:ce5442fed491e50153468d96751e82fe3490884623b1b1cf3ce47e5fb6eeb45b","observation_id":"c3902634-2cbb-4768-91eb-efa0626f97cf","resolution":{"observed_at":"2026-08-05T16:01:30.783917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":"2501.10687","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.10687","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emo2: End- effector guided audio-driven avatar video generation","venue":null,"work_id":"c9b225cf-5ef0-453a-ba3a-7bc87ee83697","year":2025},"citing_paper":{"arxiv_id":"2605.02948","last_updated":"2026-05-11T03:04:55Z","snapshot_observed_at":"2026-08-08T22:18:14.048236Z","submitted_at":"2026-05-01T16:38:06Z","title":"AsymTalker: Identity-Consistent Long-Term Talking Head Generation via Asymmetric Distillation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-09T20:19:39.565157Z"},"links":{"cited_paper":"/paper/2501.10687","citing_paper":"/paper/2605.02948"},"observation_digest":"sha256:d921ef35034485dc305ced90648fe7477f1e6edbd6533d40bf17e906fa29fecd","observation_id":"87f6a9f6-5adb-4993-9e9b-a852732d3937","resolution":{"observed_at":"2026-05-11T15:16:11.300349Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":"2501.10687","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.10687","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emo2: End- effector guided audio-driven avatar video generation","venue":null,"work_id":"c9b225cf-5ef0-453a-ba3a-7bc87ee83697","year":2025},"citing_paper":{"arxiv_id":"2605.02948","last_updated":"2026-05-11T03:04:55Z","snapshot_observed_at":"2026-08-08T22:18:14.048236Z","submitted_at":"2026-05-01T16:38:06Z","title":"AsymTalker: Identity-Consistent Long-Term Talking Head Generation via Asymmetric Distillation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-11T02:18:58.996355Z"},"links":{"cited_paper":"/paper/2501.10687","citing_paper":"/paper/2605.02948"},"observation_digest":"sha256:6ece7e8ac618861bf0764597453bf1519d3ac8590a1a5e173839fda54b517539","observation_id":"05e49444-5004-4e83-a3f8-573441607464","resolution":{"observed_at":"2026-05-11T03:45:57.529763Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":"2501.10687","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.10687","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emo2: End- effector guided audio-driven avatar video generation","venue":null,"work_id":"c9b225cf-5ef0-453a-ba3a-7bc87ee83697","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2501.10687","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:5947a0df428bb6571ce0e24c53bb37d821b58329efe6606da0b2b265843cbd0b","observation_id":"2935ab38-1ffd-44af-a3e3-0a45cc479da8","resolution":{"observed_at":"2026-05-20T15:08:24.976159Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":"2501.10687","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.10687","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emo2: End- effector guided audio-driven avatar video generation","venue":null,"work_id":"c9b225cf-5ef0-453a-ba3a-7bc87ee83697","year":2025},"citing_paper":{"arxiv_id":"2605.18467","last_updated":"2026-05-18T14:27:05Z","snapshot_observed_at":"2026-07-06T23:29:20.279470Z","submitted_at":"2026-05-18T14:27:05Z","title":"InstructAV2AV: Instruction-Guided Audio-Video Joint Editing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T11:34:32.558440Z"},"links":{"cited_paper":"/paper/2501.10687","citing_paper":"/paper/2605.18467"},"observation_digest":"sha256:306726780f5d87a38859c86b5f4e9216884cc4ddbcc4c18059d848d4f3f0d50e","observation_id":"10763ea5-837b-46f1-9cae-d67df8a3e3ae","resolution":{"observed_at":"2026-05-20T11:38:14.731854Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10687","snapshot_observed_at":"2026-08-04T06:45:48.907820Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:48.907820Z"},"links":{"cited_paper":"/paper/2501.10687","citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:4fdd25bf8ed19696b25583d9a70517769f6a9aa8c5d7de0e3806d7a6bcfb0c2c","observation_id":"74502ed6-8987-428d-8011-e947ddedcbc0","resolution":{"observed_at":"2026-08-04T06:45:48.907820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.10687/citation-record","integrity":"/paper/2501.10687/integrity","json":"/paper/2501.10687/citation-record.json","paper":"/paper/2501.10687"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:07:44.929192Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:44.929192Z"},"links":{"citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:247a1fc401129afab149b3ae8df262182162eaf76d18b6a930f798deb62de2a4","observation_id":"d46a8603-6c07-49b5-a5bc-106dfed95916","resolution":{"observed_at":"2026-08-10T19:07:44.929192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01565","last_updated":"2022-04-04T15:12:34Z","snapshot_observed_at":"2026-08-08T21:25:29.899997Z","submitted_at":"2022-04-04T15:12:34Z","title":"HiT-DVAE: Human Motion Generation via Hierarchical Transformer Dynamical VAE","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01565","snapshot_observed_at":"2026-08-10T19:07:44.934640Z","title":"Hit-dvae: Human motion generation via hierarchical transformer dynamical vae","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:44.934640Z"},"links":{"cited_paper":"/paper/2204.01565","citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:5904cb5047103595d449dc0a5494b2647d1a53e70cff7393e403e360c1e37519","observation_id":"8386d5a9-e677-48c2-9ec2-6f4df61936ea","resolution":{"observed_at":"2026-08-10T19:07:44.934640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:07:44.941565Z","title":"Animated conversation: rule-based generation of facial expression, gesture & spoken intonation for multiple conversational agents","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:44.941565Z"},"links":{"citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:91b83b6f2d601d08109f8690de085613840b77fcac70c5a13d7244afa9204105","observation_id":"67bedf89-1649-43e9-a78a-80484fddd179","resolution":{"observed_at":"2026-08-10T19:07:44.941565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-10T19:07:44.946742Z","title":"Pixart- : Fast training of diffusion transformer for photorealistic text-to-image synthesis, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:44.946742Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:34ebaa48890f91bb984d95521ef1d637258e3405e9a7c8c94612b6075549266a","observation_id":"8d0d59f4-3c71-449e-a2f9-c54b379dff2b","resolution":{"observed_at":"2026-08-10T19:07:44.946742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04747","last_updated":"2024-04-06T14:53:51Z","snapshot_observed_at":"2026-08-10T02:15:27.155252Z","submitted_at":"2024-01-09T11:38:18Z","title":"DiffSHEG: A Diffusion-Based Approach for Real-Time Speech-driven Holistic 3D Expression and Gesture Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04747","snapshot_observed_at":"2026-08-10T19:07:44.954910Z","title":"Diffsheg: A diffusion-based approach for real-time speech-driven holistic 3d expression and gesture generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:44.954910Z"},"links":{"cited_paper":"/paper/2401.04747","citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:2b6c149f6abb3f16242ecfb48aa0af3bf1236f24b189cabd64043aa295bd4608","observation_id":"e9f926d6-563b-44c8-bef6-38164e480f43","resolution":{"observed_at":"2026-08-10T19:07:44.954910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:07:46.516822Z","title":null,"venue":null,"work_id":"28fae52a-9538-45ef-b559-b1fab7b17680","year":2016},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:44.961158Z"},"links":{"citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:82799a484b899ce660c7db1037f9cfdf99cdef128fe5114746cf0d0c6eb4a047","observation_id":"228d129c-39ad-4c3b-8d2f-d83ba539746d","resolution":{"observed_at":"2026-08-10T19:07:46.520542Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:07:46.502851Z","title":"G., Kolotouros, N., Alldieck, T., and Sminchisescu, C","venue":null,"work_id":"278d5c44-22b0-479a-bd30-9828152a3465","year":2024},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:44.965021Z"},"links":{"citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:a7535b2169e2311495e5972daa55b1a09cb9995b1b91af77d456f7f50b7f3fab","observation_id":"fbe43582-34c0-4a03-ad4e-35f01f63e6ae","resolution":{"observed_at":"2026-08-10T19:07:46.508017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:07:46.488237Z","title":"Hallo2: Long-duration and high-resolution audio-driven portrait image animation, 2024 a","venue":null,"work_id":"3b769e24-743e-4235-8b98-092a486ab34e","year":2024},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:44.969066Z"},"links":{"citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:c3240c3cfbf8548c51b5dc64e72b92dab05e6eacaaceca44bc87157b3a266e1f","observation_id":"e84914e9-4063-40e7-b73d-38cc5cf1f9d1","resolution":{"observed_at":"2026-08-10T19:07:46.493196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:07:46.470217Z","title":"Hallo3: Highly dynamic and realistic portrait image animation with diffusion transformer networks, 2024 b","venue":null,"work_id":"a21264f7-d78e-480f-9b64-78c3cf76cb94","year":2024},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:44.972712Z"},"links":{"citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:5e1e0aa3b2a820c4cd4594daf18809b5725bcd2624d48d6635ad28fecc343a82","observation_id":"f1d74624-a967-4c73-96e0-e68fc9589b12","resolution":{"observed_at":"2026-08-10T19:07:46.476438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03619","last_updated":"2018-08-09T21:22:37Z","snapshot_observed_at":"2026-08-06T20:20:05.725909Z","submitted_at":"2018-04-10T16:28:59Z","title":"Looking to Listen at the Cocktail Party: A Speaker-Independent Audio-Visual Model for Speech Separation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.03619","snapshot_observed_at":"2026-08-10T19:07:44.976396Z","title":"T., and Rubinstein, M","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:44.976396Z"},"links":{"cited_paper":"/paper/1804.03619","citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:b8778f77f19e93cc1789e0fef0c9ba5728366bc2c98085f766757f9f51710c62","observation_id":"463275a5-827c-46b9-8f82-60d495c0c97e","resolution":{"observed_at":"2026-08-10T19:07:44.976396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:07:46.452635Z","title":"Faceformer: Speech-driven 3d facial animation with transformers","venue":null,"work_id":"e274870f-7fa4-4504-9566-43ef4b56f129","year":2022},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:44.980293Z"},"links":{"citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:3069f203c16cde592a7f86143f38a7f01d31d4f466cfa88232929b86270a546a","observation_id":"a1c1f1e4-48d8-4edf-962a-488e34fbd9fe","resolution":{"observed_at":"2026-08-10T19:07:46.458320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-10T19:07:44.985013Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:44.985013Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:dfc7c56a9f50783e0fe75f1664ef081649e543d46621083f44b9394a48586690","observation_id":"9199f9a0-291c-4c1d-acde-7716533e5321","resolution":{"observed_at":"2026-08-10T19:07:44.985013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.06837","last_updated":"2021-02-13T01:05:39Z","snapshot_observed_at":"2026-08-10T18:45:23.226964Z","submitted_at":"2021-02-13T01:05:39Z","title":"Learning Speech-driven 3D Conversational Gestures from Video","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.06837","snapshot_observed_at":"2026-08-10T19:07:44.989894Z","title":"Learning speech-driven 3d conversational gestures from video, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:44.989894Z"},"links":{"cited_paper":"/paper/2102.06837","citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:9fedc5cf5b61caba65cfdda8b4db08001e46e6d8df9c6fce71d1fd311904c837","observation_id":"f11fa156-1471-4c4e-ac04-000e416ee358","resolution":{"observed_at":"2026-08-10T19:07:44.989894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-08-10T19:07:44.995797Z","title":"Ltx-video: Realtime video latent diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:44.995797Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:1805f34aa54972f33b7c1c4501807645cd967530d92c9f5f1f1ad0a8a1cdbc6a","observation_id":"0074fee3-c4c0-46d7-aba1-2efbe560883b","resolution":{"observed_at":"2026-08-10T19:07:44.995797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1512.03385","last_updated":"2015-12-10T19:51:55Z","snapshot_observed_at":"2026-07-06T04:39:28.429064Z","submitted_at":"2015-12-10T19:51:55Z","title":"Deep Residual Learning for Image Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.03385","snapshot_observed_at":"2026-08-10T19:07:45.001378Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:45.001378Z"},"links":{"cited_paper":"/paper/1512.03385","citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:b380ab1342f04f21fd1725f71dcf41b82c5af281a11c71c8d4041026c37388a2","observation_id":"4e1c25aa-af23-454c-ad45-253e11896186","resolution":{"observed_at":"2026-08-10T19:07:45.001378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01862","last_updated":"2024-04-02T11:40:34Z","snapshot_observed_at":"2026-07-06T17:54:31.739953Z","submitted_at":"2024-04-02T11:40:34Z","title":"Co-Speech Gesture Video Generation via Motion-Decoupled Diffusion Model","version":1},"cited_work":{"arxiv_id":"2404.01862","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01862","snapshot_observed_at":"2026-08-10T19:07:45.873602Z","title":"Co-Speech Gesture Video Generation via Motion-Decoupled Diffusion Model","venue":"cs.CV","work_id":"1d0d881b-a946-4e9a-97cb-0d537fe27ba8","year":2024},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:45.006104Z"},"links":{"cited_paper":"/paper/2404.01862","citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:0c1e8960a9156d293c95d4f70e0d869d4ccd0321cda039ce78cf91fe3418bb0d","observation_id":"18ebd840-2307-4262-a2dc-302873d4a2f3","resolution":{"observed_at":"2026-08-10T19:07:45.886429Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:07:45.011578Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:45.011578Z"},"links":{"citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:174ec8d1744df538e8018d7323cffa843b48c4f705232e1eefbf2572e7768cf5","observation_id":"88223648-b9dd-4629-8a27-f99dc26dd8d2","resolution":{"observed_at":"2026-08-10T19:07:45.011578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:07:45.016313Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:45.016313Z"},"links":{"citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:cf6e86890eba2836c76a7fa490f649b3f3434dda79470c2e2a4915379638f6f6","observation_id":"4ec958fc-4bda-44d6-870c-1fc7f41911da","resolution":{"observed_at":"2026-08-10T19:07:45.016313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:07:46.410022Z","title":"Diffted: One-shot audio-driven ted talk video generation with diffusion-based co-speech gestures","venue":null,"work_id":"4db89597-52d9-4110-b1de-2decbec0cc2d","year":1922},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:45.022071Z"},"links":{"citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:c04d08717be45bc6351f45c7530c6ec31ee59879e790822a030ab867e68b859c","observation_id":"b951ccd4-c850-4f44-a14e-91003d0ca9bc","resolution":{"observed_at":"2026-08-10T19:07:46.415594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:07:45.036576Z","title":"and Ziou, D","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:45.036576Z"},"links":{"citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:dd425cafe659e80f7769daa9f1706249f0087483e317b9b5381e3e54933d01d8","observation_id":"5937b6f3-11fc-417b-ba9f-bf98de64a44b","resolution":{"observed_at":"2026-08-10T19:07:45.036576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17117","last_updated":"2024-06-13T06:37:20Z","snapshot_observed_at":"2026-08-10T23:27:53.135054Z","submitted_at":"2023-11-28T12:27:15Z","title":"Animate Anyone: Consistent and Controllable Image-to-Video Synthesis for Character Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17117","snapshot_observed_at":"2026-08-10T19:07:45.041640Z","title":"Animate anyone: Consistent and controllable image-to-video synthesis for character animation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:45.041640Z"},"links":{"cited_paper":"/paper/2311.17117","citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:54328851e2f29feb92513a2b77d797509bfc6cfc40a457946d67220e1b242a34","observation_id":"77191f27-01d1-46e8-b4b5-aec3957d9b58","resolution":{"observed_at":"2026-08-10T19:07:45.041640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:07:45.047215Z","title":"Nmpc-mp: Real-time nonlinear model predictive control for safe motion planning in manipulator teleoperation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:45.047215Z"},"links":{"citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:5f7612f457f12d010a7407db9a25191187857097811746b82e34b03ee95894f0","observation_id":"44580a3f-96d6-49fd-a056-12ac5ca1ad4d","resolution":{"observed_at":"2026-08-10T19:07:45.047215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05018","last_updated":"2024-02-19T13:58:33Z","snapshot_observed_at":"2026-07-06T17:13:38.033348Z","submitted_at":"2024-01-10T09:15:50Z","title":"AdvMT: Adversarial Motion Transformer for Long-term Human Motion Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05018","snapshot_observed_at":"2026-08-10T19:07:45.051463Z","title":"Advmt: Adversarial motion transformer for long-term human motion prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:45.051463Z"},"links":{"cited_paper":"/paper/2401.05018","citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:dcdb3ad66825fd76d2f69c4aa421d5c9c71e0ce197d2fe08883f1b3b10297155","observation_id":"f4e2a91a-174d-4779-b697-3027103a9d9e","resolution":{"observed_at":"2026-08-10T19:07:45.051463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02634","last_updated":"2025-04-04T05:13:40Z","snapshot_observed_at":"2026-08-05T07:44:02.175955Z","submitted_at":"2024-09-04T11:55:14Z","title":"Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02634","snapshot_observed_at":"2026-08-10T19:07:45.056563Z","title":"Loopy: Taming audio-driven portrait avatar with long-term motion dependency, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:45.056563Z"},"links":{"cited_paper":"/paper/2409.02634","citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:df18a0130c8056fcb172d4cd3b1c36e2e278f51e200b36c1f4211c570f775244","observation_id":"6506d9d8-ce50-460e-85ec-ad7e171e272d","resolution":{"observed_at":"2026-08-10T19:07:45.056563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:07:45.061330Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:45.061330Z"},"links":{"citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:2fcb2667c2246b1be3e0e26c38d1be5a05891a9c15c1f2f201f200ea9e96a963","observation_id":"1849de9f-8928-4482-91a6-580475186483","resolution":{"observed_at":"2026-08-10T19:07:45.061330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:07:46.381253Z","title":"Gesture generation by imitation: from human behavior to computer character animation","venue":null,"work_id":"2f0708f2-f397-4a2a-9ce9-74e498dcb98e","year":2005},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:45.066807Z"},"links":{"citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:e17cbab83323bee2aae5eadbee176c5a3bb99e47e9774704980850ce04978471","observation_id":"fb2e0638-a41c-4f23-8e1d-64b24ffc7402","resolution":{"observed_at":"2026-08-10T19:07:46.386197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-10T19:07:45.071971Z","title":"Hunyuanvideo: A systematic framework for large video generative models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:45.071971Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:defaa745ecb6b0d804346069d4d62271aef6e28bfb73752f2cf74ade9f887734","observation_id":"c03c436e-cf20-42e4-8987-2c72d569920b","resolution":{"observed_at":"2026-08-10T19:07:45.071971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01876","last_updated":"2025-04-05T05:31:38Z","snapshot_observed_at":"2026-08-09T18:52:43.975597Z","submitted_at":"2024-09-03T13:19:31Z","title":"CyberHost: Taming Audio-driven Avatar Diffusion Model with Region Codebook Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01876","snapshot_observed_at":"2026-08-10T19:07:45.078919Z","title":"Cyberhost: Taming audio-driven avatar diffusion model with region codebook attention, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:45.078919Z"},"links":{"cited_paper":"/paper/2409.01876","citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:5325b14b6a38c9e1aa36614abcfa0d89093a6c420dba576f9b93b1083f44e496","observation_id":"a1c41a43-2780-4aa2-8759-0477c9e9f580","resolution":{"observed_at":"2026-08-10T19:07:45.078919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:07:45.085432Z","title":"Echomimicv2: Towards striking, simplified, and semi-body human animation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:45.085432Z"},"links":{"citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:533ae40a30e7c83525976965a841f7cb85c7bc74f565bb2b8df025bb7e5a4535","observation_id":"c82a9412-fc89-4c4b-a45d-0a9c67a0331c","resolution":{"observed_at":"2026-08-10T19:07:45.085432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:07:46.362952Z","title":null,"venue":null,"work_id":"0c62047f-b088-4222-9d1f-8094ff22f214","year":2019},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:45.090369Z"},"links":{"citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:37d309c138ca0fdc65adac17253163f465f9ff11b728b4307b18793c39145b6c","observation_id":"2f71b423-7134-46b6-b857-4a00e3d21275","resolution":{"observed_at":"2026-08-10T19:07:46.368141Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09748","last_updated":"2023-03-02T09:06:55Z","snapshot_observed_at":"2026-07-06T14:32:37.317828Z","submitted_at":"2022-12-19T18:59:58Z","title":"Scalable Diffusion Models with Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09748","snapshot_observed_at":"2026-08-10T19:07:45.097251Z","title":"and Xie, S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:45.097251Z"},"links":{"cited_paper":"/paper/2212.09748","citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:9a0236c053a5d289ebbd5063f27db27663485f2200fbffd3145c146c642c75b6","observation_id":"5c10ff8d-e5f5-4378-bc79-8ba0ce10f97c","resolution":{"observed_at":"2026-08-10T19:07:45.097251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16874","last_updated":"2025-04-25T09:26:36Z","snapshot_observed_at":"2026-07-06T18:20:22.759333Z","submitted_at":"2024-05-27T06:47:14Z","title":"CoCoGesture: Toward Coherent Co-speech 3D Gesture Generation in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16874","snapshot_observed_at":"2026-08-10T19:07:45.103997Z","title":"Cocogesture: Toward coherent co-speech 3d gesture generation in the wild, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:45.103997Z"},"links":{"cited_paper":"/paper/2405.16874","citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:b591d2adba71121ff5b39ee64b0163230906dc4258dff24799a9f94ed5faf4c3","observation_id":"ebf9c7e3-b4dd-443e-adaf-850fa77ef16c","resolution":{"observed_at":"2026-08-10T19:07:45.103997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:07:45.111874Z","title":"W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:45.111874Z"},"links":{"citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:b54090d3f02a406cff047feeb95214b573423f4e235daa0fbb5a318a5feda3d4","observation_id":"53768143-aadb-48e6-b2d2-f74faa1f65b5","resolution":{"observed_at":"2026-08-10T19:07:45.111874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:07:46.332874Z","title":"Relaxedik: Real-time synthesis of accurate and feasible robot arm motion","venue":null,"work_id":"e66cdc4e-8ce5-404f-b0c5-75d89ed8f80e","year":2018},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:45.116695Z"},"links":{"citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:252e7c9114520e38944821e154a0f7f603f20224715953be167d5dc367df2c56","observation_id":"e4439a15-853c-4678-a293-ed74f93ac61f","resolution":{"observed_at":"2026-08-10T19:07:46.337969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:07:45.121336Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:45.121336Z"},"links":{"citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:316c3e87e19a6f91afca83e3b8dc3ec462fa39382cb3763f7c37cfa14402f49c","observation_id":"8e331457-34f7-4c0c-9a66-4cdf6328bc5b","resolution":{"observed_at":"2026-08-10T19:07:45.121336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:07:46.302870Z","title":null,"venue":null,"work_id":"69e17fb2-d8c2-43ef-8c76-b81cef34855a","year":2017},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:45.126608Z"},"links":{"citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:a3e95a585f4c8329a5316c1ad857c007087c0765109a0e3ee2f1d359c331a90e","observation_id":"505057dc-8778-48c5-bf85-6b9a6c0ed7f7","resolution":{"observed_at":"2026-08-10T19:07:46.309182Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:07:45.133815Z","title":"wav2vec: Unsupervised pre-training for speech recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:45.133815Z"},"links":{"citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:552a293493ca8cdcbee49193cf898731f02582410cdc29ce1c1a400c44e1b77a","observation_id":"74578a9c-e32c-4bd7-bd41-94f6772050f6","resolution":{"observed_at":"2026-08-10T19:07:45.133815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:07:46.282807Z","title":"Vote for grasp poses from noisy point sets by learning from human","venue":null,"work_id":"d520cba7-c9cc-47e4-ac87-d77a3f0f3406","year":2021},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:45.140831Z"},"links":{"citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:d04cec924f739ff07baf4aa1a51fc4b15329228ae9c2adc733652973ecb37ee6","observation_id":"96157ebc-aeee-4c4e-b14a-d6431e19f78b","resolution":{"observed_at":"2026-08-10T19:07:46.289303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:07:46.268437Z","title":"Emo: Emote portrait alive generating expressive portrait videos with audio2video diffusion model under weak conditions","venue":null,"work_id":"d4e69a6d-d0c1-46e6-be7e-5d81a63c2e77","year":2025},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:45.145649Z"},"links":{"citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:3f43e6299283465a9b7ca60fed8aa6c78e40bb8ee5cc9b7e456c12a45202dff2","observation_id":"2f562a17-fefc-400b-a4fc-f4ba3fe11830","resolution":{"observed_at":"2026-08-10T19:07:46.273197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:07:46.252370Z","title":"Fvd: A new metric for video generation","venue":null,"work_id":"92f9ba9a-a143-4d8b-9577-7aeb53ae97ff","year":2019},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:45.151434Z"},"links":{"citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:f6015d059538b7827bc61fdd7aceb140704d411ee3f28f400fe49b927a08d95a","observation_id":"f361dbad-56d2-4954-af85-754193358a02","resolution":{"observed_at":"2026-08-10T19:07:46.257115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:07:45.157527Z","title":"N., Kaiser, L","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:45.157527Z"},"links":{"citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:b0871ca6423f08c98d4c20c172260b96da6e35c20389e6fcab97c1df96e05731","observation_id":"7acbd6ea-72f6-4077-b533-af518c20911d","resolution":{"observed_at":"2026-08-10T19:07:45.157527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:07:45.162126Z","title":"Gesture and speech in interaction: An overview","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:45.162126Z"},"links":{"citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:9642bc7ab1cc875cb0db6ed6bf429c30f0ece4ff910712a290811bb76e8b7957","observation_id":"3d7b7b86-38c4-4bfa-90be-dca40b5adbe2","resolution":{"observed_at":"2026-08-10T19:07:45.162126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:07:45.167613Z","title":"Image quality assessment: from error visibility to structural similarity","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:45.167613Z"},"links":{"citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:51293d387670a877e670b5235291e50c3aab1714ba87ac83dcb7199ad4e6e222","observation_id":"1fb83bd0-0a4d-4a93-bfa4-51b0f1839c9e","resolution":{"observed_at":"2026-08-10T19:07:45.167613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:07:46.225823Z","title":null,"venue":null,"work_id":"2404cc57-d246-40d4-b714-0af41d4b788e","year":2009},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:45.174152Z"},"links":{"citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:452824f6dced6bd2348d39203736d07149d18f76ef3a8eb5273a4093a4d04d8d","observation_id":"27509708-6de1-4049-9fe8-9b3ed70fc39a","resolution":{"observed_at":"2026-08-10T19:07:46.231119Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02379","last_updated":"2023-04-03T15:58:43Z","snapshot_observed_at":"2026-07-06T14:37:56.945127Z","submitted_at":"2023-01-06T05:04:32Z","title":"CodeTalker: Speech-Driven 3D Facial Animation with Discrete Motion Prior","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02379","snapshot_observed_at":"2026-08-10T19:07:45.184586Z","title":"Codetalker: Speech-driven 3d facial animation with discrete motion prior, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:45.184586Z"},"links":{"cited_paper":"/paper/2301.02379","citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:d8774e1ea6c60457bf2f24c55d5095d8ffafec5e9c6be7fafb1374fc725b8276","observation_id":"ec6b8765-5dda-42fc-af05-9e26dc6cfdc6","resolution":{"observed_at":"2026-08-10T19:07:45.184586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-08-10T18:20:34.522853Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-10T19:07:45.189788Z","title":"Hallo: Hierarchical audio-driven visual synthesis for portrait image animation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:45.189788Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:2d34eb610ce33dcb6e0c27d2cb1ca75ff8be0bdcb94cb526549089f81ee0d23a","observation_id":"9f381e3f-ee27-49df-8c49-31809076feb7","resolution":{"observed_at":"2026-08-10T19:07:45.189788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-10T19:07:45.195734Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:45.195734Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:f870943bd124933877315bf6a36e0af49249c253392b2188f16945bc857a0399","observation_id":"ab07bcb2-4c5d-4596-b37d-d283235d03a1","resolution":{"observed_at":"2026-08-10T19:07:45.195734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:07:46.203781Z","title":null,"venue":null,"work_id":"65b08b7d-fbd7-48b0-99b7-f65ea7e3c136","year":2023},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:45.200220Z"},"links":{"citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:cfd59db801ee6abf5825c7fb0d6905186345d83d180466792a4f49477f6d9318","observation_id":"7d5fb159-6158-441c-be39-308b42c5aa0a","resolution":{"observed_at":"2026-08-10T19:07:46.210063Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:07:45.205653Z","title":"B., Liang, P","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:45.205653Z"},"links":{"citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:1c8f9e2b91bcc6f2b9ee2a47632b7a14b2adb5fae473ace3c08af69e73300152","observation_id":"a1057e2a-9171-468a-98ff-830d0206817b","resolution":{"observed_at":"2026-08-10T19:07:45.205653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19680","last_updated":"2025-06-27T10:06:13Z","snapshot_observed_at":"2026-08-09T19:19:40.842650Z","submitted_at":"2024-06-28T06:40:53Z","title":"MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19680","snapshot_observed_at":"2026-08-10T19:07:45.211874Z","title":"Mimicmotion: High-quality human motion video generation with confidence-aware pose guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:45.211874Z"},"links":{"cited_paper":"/paper/2406.19680","citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:1c761271ffa29d238d9ae1686b0818952efc8c6e1dfc0ad1ff163b756261a69e","observation_id":"6c86fe9d-7707-456b-a7fc-a79696b8ca8b","resolution":{"observed_at":"2026-08-10T19:07:45.211874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:07:46.175492Z","title":"Taming diffusion models for audio-driven co-speech gesture generation","venue":null,"work_id":"5d4e5ac3-e6cc-47ba-8ad6-8ca586d27dde","year":2023},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:45.216170Z"},"links":{"citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:f3c0aa8afc59571f9c91cee40ad414c0e2857805b0e56c8791f55508a617a0d8","observation_id":"8df9ff49-93dd-43e5-a63e-7face30e9237","resolution":{"observed_at":"2026-08-10T19:07:46.180130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:07:46.159288Z","title":"Tryondiffusion: A tale of two unets","venue":null,"work_id":"9e560ebf-45e4-43b0-a455-cfca22dfea8c","year":2023},"citing_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-10T19:07:45.221095Z"},"links":{"citing_paper":"/paper/2501.10687"},"observation_digest":"sha256:364d8d41cc4d3b34797bb5caa6384ffe213019803757b0b20b17e43887236608","observation_id":"b47c117a-3a55-44a0-a5c1-8043a8a15a17","resolution":{"observed_at":"2026-08-10T19:07:46.165297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":1,"verified_fuzzy":12},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 13 inbound Pith citation observations for arXiv:2501.10687."}