{"as_of":"2026-08-09T10:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:44546d0ef6b067ecfac5930d4fc6ff6ae3c2d3372e84066612ee44d6361d841c","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T11:07:20.577007Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.03402/citation-record","integrity":"/paper/2606.03402/integrity","json":"/paper/2606.03402/citation-record.json","paper":"/paper/2606.03402"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:07:20.577007Z","title":"Learning individual styles of conversational gesture,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.03402","last_updated":"2026-06-03T03:22:46Z","snapshot_observed_at":"2026-08-08T22:57:25.458210Z","submitted_at":"2026-06-02T09:43:55Z","title":"Mamba-Enhanced Implicit Motion Learning for Audio-Driven Portrait Animation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T11:07:20.577007Z"},"links":{"citing_paper":"/paper/2606.03402"},"observation_digest":"sha256:e0d6a8734e6a283533b820dc3db5f60ad4abe94c56893e5ba12332f93cc8c1a0","observation_id":"b5a6adb6-4462-470c-9f6b-144a2c845bf7","resolution":{"observed_at":"2026-06-28T11:07:20.577007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:07:20.577007Z","title":"No gestures left behind: Learning relationships between spoken language and freeform gestures,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.03402","last_updated":"2026-06-03T03:22:46Z","snapshot_observed_at":"2026-08-08T22:57:25.458210Z","submitted_at":"2026-06-02T09:43:55Z","title":"Mamba-Enhanced Implicit Motion Learning for Audio-Driven Portrait Animation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T11:07:20.577007Z"},"links":{"citing_paper":"/paper/2606.03402"},"observation_digest":"sha256:ed1db7ded19e9b16aad2cc78100cb025b878edfff3fa1d1c7b68f71077eaabab","observation_id":"4e645894-02ea-48af-9e78-e4fcdc479c4c","resolution":{"observed_at":"2026-06-28T11:07:20.577007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:07:20.577007Z","title":"Taming diffusion models for audio-driven co-speech gesture generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.03402","last_updated":"2026-06-03T03:22:46Z","snapshot_observed_at":"2026-08-08T22:57:25.458210Z","submitted_at":"2026-06-02T09:43:55Z","title":"Mamba-Enhanced Implicit Motion Learning for Audio-Driven Portrait Animation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T11:07:20.577007Z"},"links":{"citing_paper":"/paper/2606.03402"},"observation_digest":"sha256:a7dc76d1cc7846f3bfc4c387fb3fb69e70bc079c1f4819f4d58aab16d13bf6f2","observation_id":"6da0d01d-6d63-40ca-b80d-9e3f3b460691","resolution":{"observed_at":"2026-06-28T11:07:20.577007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14916","last_updated":"2022-10-03T09:17:41Z","snapshot_observed_at":"2026-07-06T13:57:50.746457Z","submitted_at":"2022-09-29T16:27:53Z","title":"Human Motion Diffusion Model","version":2},"cited_work":{"arxiv_id":"2209.14916","doi":"10.48550/arxiv.2209.14916","metadata_source":"pith","pith_arxiv_id":"2209.14916","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Human Motion Diffusion Model","venue":"cs.CV","work_id":"3da17802-4f2d-42ac-842b-a8bc085ae626","year":2022},"citing_paper":{"arxiv_id":"2606.03402","last_updated":"2026-06-03T03:22:46Z","snapshot_observed_at":"2026-08-08T22:57:25.458210Z","submitted_at":"2026-06-02T09:43:55Z","title":"Mamba-Enhanced Implicit Motion Learning for Audio-Driven Portrait Animation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T11:07:20.577007Z"},"links":{"cited_paper":"/paper/2209.14916","citing_paper":"/paper/2606.03402"},"observation_digest":"sha256:edc411804ca13720fcf0e90748390bede11e9ef0906a62f4b6967c0071653071","observation_id":"bd0f5c74-3bd3-49b5-b85a-ece83fcaf4ed","resolution":{"observed_at":"2026-07-02T02:16:26.579480Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:07:20.577007Z","title":"Motion-example-controlled co-speech gesture generation lever- aging large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03402","last_updated":"2026-06-03T03:22:46Z","snapshot_observed_at":"2026-08-08T22:57:25.458210Z","submitted_at":"2026-06-02T09:43:55Z","title":"Mamba-Enhanced Implicit Motion Learning for Audio-Driven Portrait Animation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T11:07:20.577007Z"},"links":{"citing_paper":"/paper/2606.03402"},"observation_digest":"sha256:ce05f21af990c13739ff26070a09227b03fbb4fa9aaa2a8fd834173a8e6b6f20","observation_id":"92fb75f9-8bb2-443b-90f5-9aa360c4c8fd","resolution":{"observed_at":"2026-06-28T11:07:20.577007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:07:20.577007Z","title":"Audio-driven co-speech gesture video generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.03402","last_updated":"2026-06-03T03:22:46Z","snapshot_observed_at":"2026-08-08T22:57:25.458210Z","submitted_at":"2026-06-02T09:43:55Z","title":"Mamba-Enhanced Implicit Motion Learning for Audio-Driven Portrait Animation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T11:07:20.577007Z"},"links":{"citing_paper":"/paper/2606.03402"},"observation_digest":"sha256:69c2ec26dbc361aee20308dd666b3cc73573c54946365b027658fc91670e505b","observation_id":"c2105a5f-21f2-4a39-a7a0-e2741edb56ae","resolution":{"observed_at":"2026-06-28T11:07:20.577007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:07:20.577007Z","title":"Motion representations for articulated animation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.03402","last_updated":"2026-06-03T03:22:46Z","snapshot_observed_at":"2026-08-08T22:57:25.458210Z","submitted_at":"2026-06-02T09:43:55Z","title":"Mamba-Enhanced Implicit Motion Learning for Audio-Driven Portrait Animation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T11:07:20.577007Z"},"links":{"citing_paper":"/paper/2606.03402"},"observation_digest":"sha256:42b1d559644b251cabf88e025f5e405eaf7ab71a8d1b9eadbbacec540b12de1f","observation_id":"17bfd2f0-6759-4d19-a2da-751c6a6e1086","resolution":{"observed_at":"2026-06-28T11:07:20.577007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:07:20.577007Z","title":"Neural discrete represen- tation learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.03402","last_updated":"2026-06-03T03:22:46Z","snapshot_observed_at":"2026-08-08T22:57:25.458210Z","submitted_at":"2026-06-02T09:43:55Z","title":"Mamba-Enhanced Implicit Motion Learning for Audio-Driven Portrait Animation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T11:07:20.577007Z"},"links":{"citing_paper":"/paper/2606.03402"},"observation_digest":"sha256:35038fe741a915b280590ef53aa31f0aa405dadad18ae96a5952256ee3008933","observation_id":"b8778e3a-54bc-458a-b758-5d85db30f31b","resolution":{"observed_at":"2026-06-28T11:07:20.577007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:07:20.577007Z","title":"Diffted: One-shot audio-driven ted talk video genera- tion with diffusion-based co-speech gestures,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03402","last_updated":"2026-06-03T03:22:46Z","snapshot_observed_at":"2026-08-08T22:57:25.458210Z","submitted_at":"2026-06-02T09:43:55Z","title":"Mamba-Enhanced Implicit Motion Learning for Audio-Driven Portrait Animation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T11:07:20.577007Z"},"links":{"citing_paper":"/paper/2606.03402"},"observation_digest":"sha256:59700d20619625b6fe0cfeb3b6b93fac5bf14c2425bca15fa95efabe48c05998","observation_id":"75d5c697-9a1f-4b0f-8f28-e867bd0299bf","resolution":{"observed_at":"2026-06-28T11:07:20.577007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:07:20.577007Z","title":"Co-speech gesture video generation via motion-decoupled diffusion model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03402","last_updated":"2026-06-03T03:22:46Z","snapshot_observed_at":"2026-08-08T22:57:25.458210Z","submitted_at":"2026-06-02T09:43:55Z","title":"Mamba-Enhanced Implicit Motion Learning for Audio-Driven Portrait Animation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T11:07:20.577007Z"},"links":{"citing_paper":"/paper/2606.03402"},"observation_digest":"sha256:db42ee21ddd8dac9c6c1de698f524d28f63746c87c32ad2042a431688395123b","observation_id":"f75f6d69-88b9-4b5b-8db6-33cfd7acb260","resolution":{"observed_at":"2026-06-28T11:07:20.577007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:07:20.577007Z","title":"Thin-plate spline motion model for image animation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.03402","last_updated":"2026-06-03T03:22:46Z","snapshot_observed_at":"2026-08-08T22:57:25.458210Z","submitted_at":"2026-06-02T09:43:55Z","title":"Mamba-Enhanced Implicit Motion Learning for Audio-Driven Portrait Animation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T11:07:20.577007Z"},"links":{"citing_paper":"/paper/2606.03402"},"observation_digest":"sha256:aadef71052d65769096a3de577449e0e2e36cef35e1bf9aafefe135e53e2bb2d","observation_id":"2119d0c0-3cfa-40ff-ab54-1abdb3ee5103","resolution":{"observed_at":"2026-06-28T11:07:20.577007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:07:20.577007Z","title":"Tango: Co- speech gesture video reenactment with hierarchical audio motion em- bedding and diffusion interpolation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03402","last_updated":"2026-06-03T03:22:46Z","snapshot_observed_at":"2026-08-08T22:57:25.458210Z","submitted_at":"2026-06-02T09:43:55Z","title":"Mamba-Enhanced Implicit Motion Learning for Audio-Driven Portrait Animation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T11:07:20.577007Z"},"links":{"citing_paper":"/paper/2606.03402"},"observation_digest":"sha256:922ea01d5da4de882feb24eb8f16f8759637587453aa17f8ca3bf1388c74f596","observation_id":"f59cd001-297c-42a8-a369-00575a57b3e1","resolution":{"observed_at":"2026-06-28T11:07:20.577007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:07:20.577007Z","title":"Hi- erarchical cross-modal talking face generation with dynamic pixel-wise loss,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.03402","last_updated":"2026-06-03T03:22:46Z","snapshot_observed_at":"2026-08-08T22:57:25.458210Z","submitted_at":"2026-06-02T09:43:55Z","title":"Mamba-Enhanced Implicit Motion Learning for Audio-Driven Portrait Animation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T11:07:20.577007Z"},"links":{"citing_paper":"/paper/2606.03402"},"observation_digest":"sha256:557e105350aedb8404ceee4be14fa070da7bf828c0ce6f54b246da0a1a3b61db","observation_id":"4c6b0061-c648-48dd-b790-a5426d9c3571","resolution":{"observed_at":"2026-06-28T11:07:20.577007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08764","last_updated":"2024-03-13T17:59:02Z","snapshot_observed_at":"2026-07-06T17:44:09.081164Z","submitted_at":"2024-03-13T17:59:02Z","title":"VLOGGER: Multimodal Diffusion for Embodied Avatar Synthesis","version":1},"cited_work":{"arxiv_id":"2403.08764","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.08764","snapshot_observed_at":"2026-07-02T02:16:26.572604Z","title":"Vlogger: Multimodal diffusion for embodied avatar synthesis","venue":null,"work_id":"f75aa125-10a2-4437-812d-c6f81b1c69ca","year":2024},"citing_paper":{"arxiv_id":"2606.03402","last_updated":"2026-06-03T03:22:46Z","snapshot_observed_at":"2026-08-08T22:57:25.458210Z","submitted_at":"2026-06-02T09:43:55Z","title":"Mamba-Enhanced Implicit Motion Learning for Audio-Driven Portrait Animation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T11:07:20.577007Z"},"links":{"cited_paper":"/paper/2403.08764","citing_paper":"/paper/2606.03402"},"observation_digest":"sha256:8c31720edf506746f5cb08c709a7ac440efc1ac84a0bbec8959a09e4eeceb2d7","observation_id":"87fa9fe3-c486-4f36-99f3-de57c8131ef1","resolution":{"observed_at":"2026-07-02T02:16:26.574247Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:07:20.577007Z","title":"Dae-talker: High fidelity speech-driven talking face generation with diffusion autoencoder,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.03402","last_updated":"2026-06-03T03:22:46Z","snapshot_observed_at":"2026-08-08T22:57:25.458210Z","submitted_at":"2026-06-02T09:43:55Z","title":"Mamba-Enhanced Implicit Motion Learning for Audio-Driven Portrait Animation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T11:07:20.577007Z"},"links":{"citing_paper":"/paper/2606.03402"},"observation_digest":"sha256:5dfedcdd06891fe59ab78cb6bca37c3c230f9882a79025d3a2583661c0ee8f11","observation_id":"c65f33e1-5e2e-41bc-8429-5f557bc43c19","resolution":{"observed_at":"2026-06-28T11:07:20.577007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:07:20.577007Z","title":"Difftalk: Crafting diffusion models for generalized audio-driven portraits animation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.03402","last_updated":"2026-06-03T03:22:46Z","snapshot_observed_at":"2026-08-08T22:57:25.458210Z","submitted_at":"2026-06-02T09:43:55Z","title":"Mamba-Enhanced Implicit Motion Learning for Audio-Driven Portrait Animation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T11:07:20.577007Z"},"links":{"citing_paper":"/paper/2606.03402"},"observation_digest":"sha256:6edf6802193b3700df93218fcab6669ebba49e734b9283d72345e581d0848d5a","observation_id":"f924338f-5f5c-4d60-a7c8-477fb7b38901","resolution":{"observed_at":"2026-06-28T11:07:20.577007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03168","last_updated":"2025-02-28T14:39:17Z","snapshot_observed_at":"2026-08-08T10:55:01.205999Z","submitted_at":"2024-07-03T14:41:39Z","title":"LivePortrait: Efficient Portrait Animation with Stitching and Retargeting Control","version":2},"cited_work":{"arxiv_id":"2407.03168","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.03168","snapshot_observed_at":"2026-07-04T06:19:38.680614Z","title":"Liveportrait: Efficient portrait animation with stitching and retargeting control","venue":null,"work_id":"a6d04417-1655-4dfd-91f6-8ac466a59dab","year":2024},"citing_paper":{"arxiv_id":"2606.03402","last_updated":"2026-06-03T03:22:46Z","snapshot_observed_at":"2026-08-08T22:57:25.458210Z","submitted_at":"2026-06-02T09:43:55Z","title":"Mamba-Enhanced Implicit Motion Learning for Audio-Driven Portrait Animation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T11:07:20.577007Z"},"links":{"cited_paper":"/paper/2407.03168","citing_paper":"/paper/2606.03402"},"observation_digest":"sha256:4920d1b8f1cf3aa7bedb5a70cd47c5df5245bb360a9e71d7a2cd0f7b6d138b3f","observation_id":"4b23342d-e65d-429d-b0eb-4c936349512c","resolution":{"observed_at":"2026-07-02T02:16:26.582293Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:07:20.577007Z","title":"Bailando: 3d dance generation by actor-critic gpt with choreographic memory,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.03402","last_updated":"2026-06-03T03:22:46Z","snapshot_observed_at":"2026-08-08T22:57:25.458210Z","submitted_at":"2026-06-02T09:43:55Z","title":"Mamba-Enhanced Implicit Motion Learning for Audio-Driven Portrait Animation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T11:07:20.577007Z"},"links":{"citing_paper":"/paper/2606.03402"},"observation_digest":"sha256:a7ec7f6dee16e10503036dbffd60868caedb26de2b37fdad226a184eb8c3719d","observation_id":"770318db-d2a2-463a-8544-8c377cfebe28","resolution":{"observed_at":"2026-06-28T11:07:20.577007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":"2403.17694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-07-02T02:16:26.575398Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","venue":null,"work_id":"d41ca9c8-5720-452c-86ce-b4d81eaf7dee","year":2024},"citing_paper":{"arxiv_id":"2606.03402","last_updated":"2026-06-03T03:22:46Z","snapshot_observed_at":"2026-08-08T22:57:25.458210Z","submitted_at":"2026-06-02T09:43:55Z","title":"Mamba-Enhanced Implicit Motion Learning for Audio-Driven Portrait Animation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T11:07:20.577007Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2606.03402"},"observation_digest":"sha256:76b2744b7de429f1126ae1ff71e3bebeb87a990e7263e9022a8f37edfebd01a6","observation_id":"eba3d6fb-668c-474d-a03d-982536240543","resolution":{"observed_at":"2026-07-02T02:16:26.577129Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:07:20.577007Z","title":"Depth-aware generative adversarial network for talking head video generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.03402","last_updated":"2026-06-03T03:22:46Z","snapshot_observed_at":"2026-08-08T22:57:25.458210Z","submitted_at":"2026-06-02T09:43:55Z","title":"Mamba-Enhanced Implicit Motion Learning for Audio-Driven Portrait Animation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T11:07:20.577007Z"},"links":{"citing_paper":"/paper/2606.03402"},"observation_digest":"sha256:617b31c6a09a2eaf82183c7d95b5b6bcfe09443add033c6ffa748ba947028d42","observation_id":"e09e6503-d418-4b14-9e8d-6ba0ce77f004","resolution":{"observed_at":"2026-06-28T11:07:20.577007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:07:20.577007Z","title":"First order motion model for image animation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.03402","last_updated":"2026-06-03T03:22:46Z","snapshot_observed_at":"2026-08-08T22:57:25.458210Z","submitted_at":"2026-06-02T09:43:55Z","title":"Mamba-Enhanced Implicit Motion Learning for Audio-Driven Portrait Animation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T11:07:20.577007Z"},"links":{"citing_paper":"/paper/2606.03402"},"observation_digest":"sha256:ce8e2c0a6b96dbf714c44bbf683e45133584497e1a5523ee61ad5e37aa600665","observation_id":"619f22c8-cd4d-465f-bfa5-d0cce06b6341","resolution":{"observed_at":"2026-06-28T11:07:20.577007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:07:20.577007Z","title":"Implicit identity representation conditioned memory compensation network for talking head video generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.03402","last_updated":"2026-06-03T03:22:46Z","snapshot_observed_at":"2026-08-08T22:57:25.458210Z","submitted_at":"2026-06-02T09:43:55Z","title":"Mamba-Enhanced Implicit Motion Learning for Audio-Driven Portrait Animation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T11:07:20.577007Z"},"links":{"citing_paper":"/paper/2606.03402"},"observation_digest":"sha256:1860da9007aa49626094aa9feec71806fc8692e4bd16b6ee09d03c29998a38e7","observation_id":"5f084547-e30c-4e2c-b0e1-2f95e58bca70","resolution":{"observed_at":"2026-06-28T11:07:20.577007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:07:20.577007Z","title":"X-portrait: Expressive portrait animation with hierarchical motion attention,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03402","last_updated":"2026-06-03T03:22:46Z","snapshot_observed_at":"2026-08-08T22:57:25.458210Z","submitted_at":"2026-06-02T09:43:55Z","title":"Mamba-Enhanced Implicit Motion Learning for Audio-Driven Portrait Animation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T11:07:20.577007Z"},"links":{"citing_paper":"/paper/2606.03402"},"observation_digest":"sha256:e69e1dc1e4381ae157703417d189f2d656c5aef1a37aa295b5a3ee38f87f7a88","observation_id":"2a40040a-5125-4d6d-b3aa-cc6380bb1cf4","resolution":{"observed_at":"2026-06-28T11:07:20.577007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:07:20.577007Z","title":"Hallo2: Long-duration and high-resolution audio-driven portrait image animation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03402","last_updated":"2026-06-03T03:22:46Z","snapshot_observed_at":"2026-08-08T22:57:25.458210Z","submitted_at":"2026-06-02T09:43:55Z","title":"Mamba-Enhanced Implicit Motion Learning for Audio-Driven Portrait Animation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T11:07:20.577007Z"},"links":{"citing_paper":"/paper/2606.03402"},"observation_digest":"sha256:d1a33b5b5d498e636b728a200d424b6f8d41f60a91eca64856d2ecf6988729bf","observation_id":"0e604475-766f-4dce-94e6-007d13abbee7","resolution":{"observed_at":"2026-06-28T11:07:20.577007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.03402","last_updated":"2026-06-03T03:22:46Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T22:57:25.458210Z","submitted_at":"2026-06-02T09:43:55Z","title":"Mamba-Enhanced Implicit Motion Learning for Audio-Driven Portrait Animation"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2606.03402."}