{"as_of":"2026-08-08T08:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3923d0efce084336d61fa2d7d4098d0bd9655d939f0bc27fd649c44d58086ca6","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:39:13.746751Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.18096/citation-record","integrity":"/paper/2505.18096/integrity","json":"/paper/2505.18096/citation-record.json","paper":"/paper/2505.18096"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:23.903021Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations.Advances in neural infor- mation processing systems, 33:12449–12460, 2020","venue":null,"work_id":"c27b8438-5b72-4bfe-80e9-17ce34989a54","year":2020},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:06.664873Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:373824eebdfef1f35024b9797bdc576518ebf9b24de9595c2e4ea277063423f9","observation_id":"d3b796bc-c835-4589-85c3-27c5b74dad10","resolution":{"observed_at":"2026-08-07T14:39:24.059388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:23.597691Z","title":"High-fidelity fa- cial avatar reconstruction from monocular video with gen- erative priors","venue":null,"work_id":"b4ad5f02-d74a-4deb-aa23-4c44e3d8bafc","year":2023},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:06.727929Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:5f7d104b95d4ba2a882daba5bf5c2ec1a912af818db5d481a6781a42ef274a0e","observation_id":"06a19676-da99-4faa-b7bf-e69fd9de279f","resolution":{"observed_at":"2026-08-07T14:39:23.759935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:23.201277Z","title":"Pyannote","venue":null,"work_id":"6e099a3d-87be-4bcb-b981-c236ab64a6cd","year":2020},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:06.854167Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:8aaed912442d46e0e5b777a051d4469287814be1bb8901806959451a4008afff","observation_id":"ff12b923-45aa-4306-a924-592a3dcc8f5a","resolution":{"observed_at":"2026-08-07T14:39:23.359982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:22.856676Z","title":"Expressive speech-driven facial animation.ACM Transactions on Graphics (TOG), 24(4):1283–1302, 2005","venue":null,"work_id":"4016d554-ff51-4956-be25-f3d729604e43","year":2005},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:06.984124Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:5cb25a4a77ff0f1a91c823eb2628f7128c6f7944d4fef21df262c34cbea409d7","observation_id":"84ff27c2-43a8-4706-a46d-1e6bacefe58d","resolution":{"observed_at":"2026-08-07T14:39:23.050517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:22.500221Z","title":"Human conversation as a system framework: Designing embodied conversational agents.Em- bodied conversational agents, pages 29–63, 2000","venue":null,"work_id":"2f94e221-8105-4d58-a389-c1a60dd2d18e","year":2000},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:07.100300Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:3cdf905abf35380caf2108f73b6779a76c5bd66211da24c2e5629b91f52bedd6","observation_id":"3f2b911b-466e-4456-ba0a-cab1070360c2","resolution":{"observed_at":"2026-08-07T14:39:22.655777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:22.230657Z","title":"Cafe-talk: Generating 3d talking face animation with mul- timodal coarse-and fine-grained control","venue":null,"work_id":"27ee7824-f4bd-4bb1-9a0c-365b17230497","year":null},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:07.224197Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:7ed28962d85bdaa4f2634ff56eb07f5cb28b2c05450136387e503b66c3b82356","observation_id":"c4643fe1-6037-4362-b040-2837c21949fe","resolution":{"observed_at":"2026-08-07T14:39:22.372229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:21.807957Z","title":"Capture, learning, and synthe- sis of 3d speaking styles","venue":null,"work_id":"e4ab509c-06bb-4ef6-8836-067dd2a6e5a9","year":2019},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:07.362385Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:783608a41375a5db6e38df9488077b327ae57364e90a34f717a31016c7e88306","observation_id":"fd2b9128-deaf-4bc0-a755-0d6898416b8a","resolution":{"observed_at":"2026-08-07T14:39:22.019144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:21.592592Z","title":null,"venue":null,"work_id":"6122b01b-5ed5-46d0-9dbb-ca4f1e8879de","year":2022},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:07.466214Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:f86e19494711a657ba7cecd2e5834c2cf1d71fa53d024a60952052743032173f","observation_id":"8d7d3b56-896f-4f2f-8a5a-3977234923ad","resolution":{"observed_at":"2026-08-07T14:39:21.672545Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00762","last_updated":"2024-08-01T17:59:27Z","snapshot_observed_at":"2026-07-06T18:55:45.493755Z","submitted_at":"2024-08-01T17:59:27Z","title":"UniTalker: Scaling up Audio-Driven 3D Facial Animation through A Unified Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00762","snapshot_observed_at":"2026-08-07T14:39:07.573603Z","title":"Unitalker: Scaling up audio-driven 3d facial animation through a unified model.arXiv preprint arXiv:2408.00762,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:07.573603Z"},"links":{"cited_paper":"/paper/2408.00762","citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:ec72e2c73381f227c55c69cb9f45c515909b79e595f4151e6e48f3bd86a7cf94","observation_id":"dfd6207e-f5b7-464a-90d4-e2c7fbae2d00","resolution":{"observed_at":"2026-08-07T14:39:07.573603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:21.456649Z","title":"Faceformer: Speech-driven 3d facial anima- tion with transformers","venue":null,"work_id":"62b1cdee-60f6-4f54-af84-e0b6aa59019e","year":2022},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:07.722156Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:f7b01ab04ee1c1e36e9fc0afb65f52364c17636469d1a8bfa9bc8e2ec8e6ebd7","observation_id":"4827c36e-ac0c-4dd1-970f-f3ce33a5c38a","resolution":{"observed_at":"2026-08-07T14:39:21.535978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:21.315440Z","title":"A 3-d audio-visual corpus of af- fective communication.IEEE Transactions on Multimedia, 12(6):591–598, 2010","venue":null,"work_id":"0dfe71a2-375b-4285-81f7-ef9d2941b795","year":2010},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:07.853427Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:5c1b6cc293295117a874a3e59a746526cf2c4f8a542a939ff45869a56c7ddcd3","observation_id":"7cc3a6c8-ad41-4a75-8f5a-08ec483ea04b","resolution":{"observed_at":"2026-08-07T14:39:21.366870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.10939","last_updated":"2023-01-26T05:00:09Z","snapshot_observed_at":"2026-07-06T14:44:45.326057Z","submitted_at":"2023-01-26T05:00:09Z","title":"Affective Faces for Goal-Driven Dyadic Communication","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.10939","snapshot_observed_at":"2026-08-07T14:39:07.961032Z","title":"Affective faces for goal-driven dyadic communication.arXiv preprint arXiv:2301.10939, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:07.961032Z"},"links":{"cited_paper":"/paper/2301.10939","citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:5f06b629d222f7e52fc311809ce6ceff6258a1a38a4d57bb88e827185d65a9c1","observation_id":"55544b14-4360-47ec-b385-6c9b16d8e246","resolution":{"observed_at":"2026-08-07T14:39:07.961032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16041","last_updated":"2026-07-07T09:51:43Z","snapshot_observed_at":"2026-07-10T23:17:12.722831Z","submitted_at":"2023-08-30T14:00:48Z","title":"From Pixels to Portraits: A Comprehensive Survey of Talking Head Generation Techniques and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16041","snapshot_observed_at":"2026-08-07T14:39:08.118474Z","title":"From pixels to portraits: A comprehensive survey of talking head generation tech- niques and applications.arXiv preprint arXiv:2308.16041,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:08.118474Z"},"links":{"cited_paper":"/paper/2308.16041","citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:dcb88dda44dadef90974361c71fe0fab8fc76073124b242aeea4ef82b2ed0287","observation_id":"eddc3004-6431-47f9-8f8d-d31ca1d0e223","resolution":{"observed_at":"2026-08-07T14:39:08.118474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:21.092796Z","title":"Long short-term memory.Neural Computation MIT-Press, 1997","venue":null,"work_id":"15fd019d-86db-465a-a75c-984e2f21cb6c","year":1997},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:08.246824Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:113493b577498e94e31a0d06b28e9398ee6be0cf5e1d3d1585e5bd4bacf58496","observation_id":"ca303e15-0c16-4bb4-be8e-e2eac657cb9a","resolution":{"observed_at":"2026-08-07T14:39:21.231329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:20.871353Z","title":"Toward rnn based micro non-verbal behavior generation for virtual listener agents","venue":null,"work_id":"7ca9c7f9-4f83-4530-adf5-fe6627551a3d","year":2019},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:08.357873Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:794c2548b0d193e4b811955567af2ffa0cfea1290a8fb4b61fc2ea99c5f68a9c","observation_id":"3f0ddd31-29ba-466f-b13e-f4d3ebfcf144","resolution":{"observed_at":"2026-08-07T14:39:20.979997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:08.474671Z","title":"Audio-driven facial animation by joint end- to-end learning of pose and emotion.ACM Transactions on Graphics (TOG), 36(4):1–12, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:08.474671Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:9003027403edd75fa744a57c1199e2b395b634441f2c4a6468a7f51d5c359faf","observation_id":"6309504b-f066-41d6-953b-f129ecc8e25b","resolution":{"observed_at":"2026-08-07T14:39:08.474671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T14:39:08.615584Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:08.615584Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:3c88185aa0b89756bad212d2d7650edc4aed1622a1ed997d161251c9250f31aa","observation_id":"7ef5a1c9-c907-4aac-9f80-de3e4a631326","resolution":{"observed_at":"2026-08-07T14:39:08.615584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:20.630308Z","title":"Iianet: An intra-and inter-modality attention network for audio- visual speech separation","venue":null,"work_id":"5061be30-d4d2-45fe-a28a-98a57cb941b2","year":2024},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:08.753831Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:a0e62a5a4b5c512e5163b22c67ced7d2565ac3e849f32908ab680b5b179c1dfe","observation_id":"a180a451-e273-4a16-9e5e-ae34426f373f","resolution":{"observed_at":"2026-08-07T14:39:20.711792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:20.389986Z","title":"Learning a model of facial shape and expression from 4d scans.ACM Trans","venue":null,"work_id":"061d5175-f623-4226-9783-fed0dfcf693c","year":2017},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:08.849891Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:2b82bb79c449129a8a50186f52a8f97fb92637bb903d1d8d375e7f122296fc7f","observation_id":"29ff24c6-5222-46b6-941d-14e1c6653dd4","resolution":{"observed_at":"2026-08-07T14:39:20.498754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:20.076558Z","title":"One-shot high-fidelity talking- head synthesis with deformable neural radiance field","venue":null,"work_id":"b53c47a4-197d-428c-a5fb-cb161bc7225b","year":2023},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:08.936420Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:eb2d47f0d576399c81b6ef0db13af8aa993265ffd9e29c55c75ae1dcaf8ba431","observation_id":"4d1a5a81-b6b6-4ed5-894c-c1e9831dc938","resolution":{"observed_at":"2026-08-07T14:39:20.205414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:19.878969Z","title":"Proactive con- versational agents in the post-chatgpt world","venue":null,"work_id":"2b1d0684-3039-42db-8e70-c99e8344f75f","year":2023},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:09.113832Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:b2151f50ecfdf5e99495c537174936a99b82b54b0beb6ce7da8573c38a1c0727","observation_id":"7b4f4828-477d-4500-9c81-0c5ef5543cc2","resolution":{"observed_at":"2026-08-07T14:39:19.990434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:19.640457Z","title":"Mfr-net: Multi-faceted responsive listening head generation via denoising diffusion model","venue":null,"work_id":"89925050-3544-4dd1-ba1b-37ea9f4e8e6b","year":2023},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:09.273424Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:650fe6c00a3b46bf7aa349c0841a924a7d94b1f279b46aad30cbd285b56fbe27","observation_id":"d54a3abc-70b4-4dbc-b34d-9f4fd95a92ca","resolution":{"observed_at":"2026-08-07T14:39:19.774491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:19.429651Z","title":"Customlistener: Text-guided responsive inter- action for user-friendly listening head generation","venue":null,"work_id":"41014589-256c-48d8-bedc-25678af0fb29","year":2024},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:09.391277Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:5c3dabfbe6a49f95e4638048ba8226489443e9615661b006532b83ff6f9caff8","observation_id":"7eaf8bea-ed03-437c-af30-c8df55ba20ab","resolution":{"observed_at":"2026-08-07T14:39:19.530943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08172","last_updated":"2019-06-14T05:49:22Z","snapshot_observed_at":"2026-08-05T19:15:35.517082Z","submitted_at":"2019-06-14T05:49:22Z","title":"MediaPipe: A Framework for Building Perception Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08172","snapshot_observed_at":"2026-08-07T14:39:09.516177Z","title":"Medi- apipe: A framework for building perception pipelines.arXiv preprint arXiv:1906.08172, 2019","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:09.516177Z"},"links":{"cited_paper":"/paper/1906.08172","citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:eb62f407fb49528517efefbf5ff49101c4bb048b78a1f94373f1cdd69ced60cb","observation_id":"5644a605-6430-4064-a6ec-56219208bce4","resolution":{"observed_at":"2026-08-07T14:39:09.516177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15748","last_updated":"2024-11-04T00:48:12Z","snapshot_observed_at":"2026-07-06T15:33:06.904026Z","submitted_at":"2023-05-25T05:55:53Z","title":"ReactFace: Online Multiple Appropriate Facial Reaction Generation in Dyadic Interactions","version":2},"cited_work":{"arxiv_id":"2305.15748","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.15748","snapshot_observed_at":"2026-08-07T14:39:13.965840Z","title":"ReactFace: Online Multiple Appropriate Facial Reaction Generation in Dyadic Interactions","venue":"cs.CV","work_id":"ffced95d-938b-4538-b89b-d8d508bd8df3","year":2023},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:09.681648Z"},"links":{"cited_paper":"/paper/2305.15748","citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:929e3602eb9c08592fff1131fcc72c4add20fe5bd7eb6ff4f3df675ff2ae7590","observation_id":"4abc0771-f79b-42ec-9f2a-145e8594ce56","resolution":{"observed_at":"2026-08-07T14:39:14.078463Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05712","last_updated":"2024-02-08T14:39:16Z","snapshot_observed_at":"2026-08-04T13:02:13.622096Z","submitted_at":"2024-02-08T14:39:16Z","title":"DiffSpeaker: Speech-Driven 3D Facial Animation with Diffusion Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05712","snapshot_observed_at":"2026-08-07T14:39:09.795467Z","title":"Diffspeaker: Speech-driven 3d facial animation with diffusion transformer.arXiv preprint arXiv:2402.05712, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:09.795467Z"},"links":{"cited_paper":"/paper/2402.05712","citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:4ebc9bef2baf681018d613ea64003bec7f9eeb9294e12609c82a51d06bf7dd71","observation_id":"474495de-3784-412f-b3f0-820278826618","resolution":{"observed_at":"2026-08-07T14:39:09.795467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:19.168176Z","title":"Learning to listen: Modeling non-deterministic dyadic facial motion","venue":null,"work_id":"8212cf2a-5204-4e8f-8afd-8013bf8b0c34","year":2022},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:09.900396Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:891c44e8ae14497f1a6e704d13eaa194db1632f5b9ad42f4572ac7a0a4e41d66","observation_id":"323b7c63-c06b-4cf7-af42-8cf5fb3c9973","resolution":{"observed_at":"2026-08-07T14:39:19.277225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:18.956243Z","title":"Can language models learn to listen? InProceedings of the IEEE/CVF In- ternational Conference on Computer Vision, pages 10083– 10093, 2023","venue":null,"work_id":"82485a33-df7a-406f-9d5a-bb10cb2498b5","year":2023},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:10.012426Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:a922434c853274198b544dc606a2c904ab51df995a1df16250ebe14ee6a0cbb9","observation_id":"3edcf984-b1f2-4670-b137-3871b492d646","resolution":{"observed_at":"2026-08-07T14:39:19.076045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:18.688744Z","title":"From audio to photoreal embodiment: Synthesizing humans in conversations","venue":null,"work_id":"be1047c6-d97f-45c1-b5c5-ee125677f220","year":2024},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:10.117617Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:a243b5d995f0176be87393170451ffd93a55192ae9b08bdafd21ab90f2f9e433","observation_id":"6149e777-ba56-4bfb-ab1c-234408708823","resolution":{"observed_at":"2026-08-07T14:39:18.821438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:18.470728Z","title":"Real-time 3d talking head from a synthetic viseme dataset","venue":null,"work_id":"b5144041-beea-403b-a471-906aa969b36e","year":2009},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:10.259878Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:1cb2de5e81cf240431f23bb42f780456eeed6ac7574b5f29f2abeebbb3416459","observation_id":"2d384c6f-2910-4821-bb5d-474f55be4d64","resolution":{"observed_at":"2026-08-07T14:39:18.577419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10942","last_updated":"2024-09-25T09:42:45Z","snapshot_observed_at":"2026-08-06T23:02:47.092311Z","submitted_at":"2024-03-16T14:58:58Z","title":"ScanTalk: 3D Talking Heads from Unregistered Scans","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10942","snapshot_observed_at":"2026-08-07T14:39:10.356811Z","title":"Scantalk: 3d talking heads from unregistered scans.arXiv preprint arXiv:2403.10942, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:10.356811Z"},"links":{"cited_paper":"/paper/2403.10942","citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:a7f0d426c9addf408005a51655c4d18d1ae4298376567b109d5b19c03cbec8da","observation_id":"298d4bb5-b1bd-42a8-bfd0-31f5d2d268f1","resolution":{"observed_at":"2026-08-07T14:39:10.356811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:10.470371Z","title":"Dpe: Dis- entanglement of pose and expression for general video por- trait editing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:10.470371Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:b26a73f75b56ad2ade25125b44d998c6f66f6fc1abbb559ff66ba4756bb530e4","observation_id":"22857179-683d-4e48-a559-6bea681d0ce2","resolution":{"observed_at":"2026-08-07T14:39:10.470371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:18.245434Z","title":"Selftalk: A self- supervised commutative training diagram to comprehend 3d talking faces","venue":null,"work_id":"271b3f8d-9b49-4246-b89d-0afa4f75bfb8","year":2023},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:10.596544Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:b1e5ba49cc0a9486c6b01b161e1943c2ca73052a7bef715c03134bad791f787f","observation_id":"b777e672-7a0f-4494-b473-a645593ed547","resolution":{"observed_at":"2026-08-07T14:39:18.342972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:18.048949Z","title":"Emotalk: Speech-driven emotional disentanglement for 3d face anima- tion","venue":null,"work_id":"5932ce0e-3caa-4fc1-b536-e70cc8c44ec1","year":2023},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:10.717041Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:97f2f2bb5ced6556f6707faa53f2f9633ed2878d663abc9d1c5356ea92293220","observation_id":"cf1bd416-72da-4c94-bef3-b8f3d1f3b6c9","resolution":{"observed_at":"2026-08-07T14:39:18.136046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:17.813282Z","title":"Synctalk: The devil is in the synchronization for talking head synthesis","venue":null,"work_id":"0b6e7dca-7a42-4426-9f7a-6379cca65d19","year":null},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:10.847276Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:b52917c93708d58e6499a7e4213db213721b144e9ac801305c1713697c4b2efc","observation_id":"3b82443b-c7d1-49ac-a94f-fbc492e180dd","resolution":{"observed_at":"2026-08-07T14:39:17.923327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:17.558430Z","title":"Meshtalk: 3d face an- imation from speech using cross-modality disentanglement","venue":null,"work_id":"07917e74-885f-4da2-a8c6-ae52c7a7dd9d","year":2021},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:11.024346Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:f91a210a62fed6208703aafa77ab67e9804104a379685b7f7a4368a23c4c6f3b","observation_id":"ca293a36-ff56-41e0-bb22-1ebf757d3c72","resolution":{"observed_at":"2026-08-07T14:39:17.685594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:17.367526Z","title":"Emotional listener portrait: Neural lis- tener head generation with emotion","venue":null,"work_id":"e2a0e42e-b6a5-4431-a86f-fb4611b43c7a","year":2023},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:11.164248Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:a59365a5bd578f2df9af7157e219d4ece1c7321d81045bb6bc49123de6ff58d4","observation_id":"744d021a-c70d-45b0-8101-8011d94f188f","resolution":{"observed_at":"2026-08-07T14:39:17.459200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:17.116409Z","title":"React2023: The first multiple appropriate facial reaction generation chal- lenge","venue":null,"work_id":"26e0c40c-ebd7-4847-8c5d-89abb53bfea3","year":2023},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:11.336635Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:04981ce03f61ca71bc5501d28fc9fc01690bd2bb77f7fefe61d534a1b143e83f","observation_id":"422e804e-b1db-41f4-84f9-84e6df6d5335","resolution":{"observed_at":"2026-08-07T14:39:17.268369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.04838","last_updated":"2020-08-11T16:37:59Z","snapshot_observed_at":"2026-08-07T21:35:40.193492Z","submitted_at":"2020-08-11T16:37:59Z","title":"TransNet V2: An effective deep network architecture for fast shot transition detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.04838","snapshot_observed_at":"2026-08-07T14:39:11.450440Z","title":"Transnet v2: An effective deep network architecture for fast shot transition detection","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:11.450440Z"},"links":{"cited_paper":"/paper/2008.04838","citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:4be61840b72214bd6193d0e761c170401e45798eac9dd4c29c2c2c09d2afc9cb","observation_id":"6cd5d85d-b83a-4509-8cbc-15c47c3a9567","resolution":{"observed_at":"2026-08-07T14:39:11.450440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:16.925911Z","title":"Laughtalk: Expressive 3d talking head generation with laughter","venue":null,"work_id":"30bce023-6477-4756-8c9d-6011fce5a9ed","year":2024},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:11.606460Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:4e86a68e208ac3e2a38286edfb4499c06cdac2608c3e37492a146e5876f5eaea","observation_id":"8c9f52ef-28d9-45f5-9f83-a0ceb0336a92","resolution":{"observed_at":"2026-08-07T14:39:17.031219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:16.763979Z","title":"Imitator: Personalized speech-driven 3d facial animation","venue":null,"work_id":"2654f7fe-2495-43df-b513-68aad43a7014","year":2023},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:11.704385Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:4f59e9a2363c35f41c2300ba67ad17a4449cd288d84329e4f0edf549213b5bb5","observation_id":"03f9e27e-2e52-44d7-b817-9560636c1dfe","resolution":{"observed_at":"2026-08-07T14:39:16.845207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09069","last_updated":"2024-07-17T21:53:41Z","snapshot_observed_at":"2026-08-01T08:57:25.832861Z","submitted_at":"2024-03-14T03:21:33Z","title":"Dyadic Interaction Modeling for Social Behavior Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09069","snapshot_observed_at":"2026-08-07T14:39:11.891223Z","title":"Dyadic interaction modeling for social behavior generation.arXiv preprint arXiv:2403.09069, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:11.891223Z"},"links":{"cited_paper":"/paper/2403.09069","citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:c90025a551c10f2dc7ee6d62e8e9bf34918203fba855f68bdee5f38ffc9deb4d","observation_id":"c45ad741-e225-4f69-90c9-ea95eaa12a2b","resolution":{"observed_at":"2026-08-07T14:39:11.891223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:16.522702Z","title":"Attention is all you need.Advances in Neural Information Processing Systems, 2017","venue":null,"work_id":"4f3a74bd-ff78-4662-a03d-018ca71ed4b6","year":2017},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:12.029845Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:2dca13d665bd72184c029e988f031e673fcb1e7c036aa2c7a43a031e10b6f167","observation_id":"5cc2cdf7-7a8a-4c89-a0db-6bd81d8d7aae","resolution":{"observed_at":"2026-08-07T14:39:16.620401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09740","last_updated":"2024-09-17T08:00:50Z","snapshot_observed_at":"2026-08-07T20:52:29.239646Z","submitted_at":"2024-09-15T14:10:31Z","title":"VGG-Tex: A Vivid Geometry-Guided Facial Texture Estimation Model for High Fidelity Monocular 3D Face Reconstruction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09740","snapshot_observed_at":"2026-08-07T14:39:12.156492Z","title":"Vgg-tex: A vivid geometry-guided facial texture estimation model for high fidelity monocular 3d face reconstruction.arXiv preprint arXiv:2409.09740, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:12.156492Z"},"links":{"cited_paper":"/paper/2409.09740","citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:ea6bce174fa55dcba67206a427b485cabe46dc0234482e3d6f656a0a3597946c","observation_id":"91285c40-8cba-4b34-8140-50857e423498","resolution":{"observed_at":"2026-08-07T14:39:12.156492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08155","last_updated":"2023-10-03T20:47:10Z","snapshot_observed_at":"2026-07-31T19:03:03.494918Z","submitted_at":"2023-08-16T05:57:52Z","title":"AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08155","snapshot_observed_at":"2026-08-07T14:39:12.290540Z","title":"Autogen: Enabling next-gen llm ap- plications via multi-agent conversation framework.arXiv preprint arXiv:2308.08155, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:12.290540Z"},"links":{"cited_paper":"/paper/2308.08155","citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:1f06dcdc124b8e8d2e4c9ccb8b0e998ebe6cb0385f0fef8c1a5f13d324490b8f","observation_id":"f0df8f66-6cb5-4eb3-8895-e9c2949a2219","resolution":{"observed_at":"2026-08-07T14:39:12.290540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:16.370397Z","title":"Codetalker: Speech-driven 3d facial animation with discrete motion prior","venue":null,"work_id":"661c5c62-a006-4d28-9c09-4441f76b2697","year":2023},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:12.406648Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:86356f6a3555709c0d88210229b47cdee6c910b4a4f42ded1d71df03adf3e116","observation_id":"563c1a0b-a1bb-428e-946d-541f3395724e","resolution":{"observed_at":"2026-08-07T14:39:16.436078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:16.183227Z","title":"Nofa: Nerf-based one-shot facial avatar recon- struction","venue":null,"work_id":"b519832e-5a57-4417-8abb-d090aa722b92","year":2023},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:12.535992Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:9e2b6a6988416a5871b78ea83e93e08c8138d8d4cc4ce72c339441fb686c202a","observation_id":"c93a91c0-ced5-4d0f-b9c0-7e464d4e2201","resolution":{"observed_at":"2026-08-07T14:39:16.283323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:15.968833Z","title":"Human-computer interaction system: A survey of talking-head generation.Electronics, 12(1):218, 2023","venue":null,"work_id":"e1406497-d6e7-4dc2-b0c4-e2cfd927c164","year":2023},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:12.656839Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:a420a6113a5fdc7cfebcf4452df4185cd4aae6e00455d3840194acd10c79cff3","observation_id":"2e539a54-fe2a-433d-aafa-2864bcae76bc","resolution":{"observed_at":"2026-08-07T14:39:16.057653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:15.723332Z","title":"Responsive listening head generation: a benchmark dataset and baseline","venue":null,"work_id":"4bada142-552d-400e-9ce9-4801fe996a57","year":2022},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:12.761642Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:a23d09a8046f81d6953021760990403679b21fa3ccfb7279a7d24d5b36bb3f0e","observation_id":"bfb7cbfd-d1cd-4672-8cd5-d9f5676e63dd","resolution":{"observed_at":"2026-08-07T14:39:15.836708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09357","last_updated":"2024-08-18T04:42:43Z","snapshot_observed_at":"2026-08-07T20:52:24.135290Z","submitted_at":"2024-08-18T04:42:43Z","title":"Meta-Learning Empowered Meta-Face: Personalized Speaking Style Adaptation for Audio-Driven 3D Talking Face Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09357","snapshot_observed_at":"2026-08-07T14:39:12.873023Z","title":"Meta-learning empowered meta-face: Personalized speaking style adap- tation for audio-driven 3d talking face animation.arXiv preprint arXiv:2408.09357, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:12.873023Z"},"links":{"cited_paper":"/paper/2408.09357","citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:e028b37015fddf44c096af8b90c076b3dc51aa4b6a4a80cfea6b6a3aa3c33e20","observation_id":"e6428501-3063-4c70-be21-f5a5aa78b528","resolution":{"observed_at":"2026-08-07T14:39:12.873023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:15.551369Z","title":"Visemenet: Audio- driven animator-centric speech animation.ACM Transac- tions on Graphics (TOG), 37(4):1–10, 2018","venue":null,"work_id":"f689cef8-17dc-4b2b-a92d-19cc36913db7","year":2018},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:12.982202Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:2b9ffc958d4c6443869c014a2730cd9d28d45e11a85aca226a01b6155565abf6","observation_id":"22127174-c4f6-4c6c-8004-ca10ebe3e35d","resolution":{"observed_at":"2026-08-07T14:39:15.631924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:15.340394Z","title":"Network Architecture In this section, we provide comprehensive implementation details of our DualTalk framework","venue":null,"work_id":"16e671ba-03b3-4405-a5b9-fedd555de3bb","year":null},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:13.092431Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:6ab7776665743c2fa8507690d43e823a0991f104869749792b12aa755cc017b9","observation_id":"e4c46f00-d496-4697-8ba5-f8be58c03463","resolution":{"observed_at":"2026-08-07T14:39:15.443570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:14.833184Z","title":"Here, we provide detailed in- formation about our data collection, processing procedures, and dataset statistics","venue":null,"work_id":"20436344-4846-4556-9104-1b61dfd30922","year":1920},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:13.359279Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:e8e0aa2d93475f16b2433415261533e4a5034c07f1ef80bceb4c848645329144","observation_id":"9660e38e-2e40-4514-b2d1-b2349330c556","resolution":{"observed_at":"2026-08-07T14:39:14.955563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:14.628349Z","title":null,"venue":null,"work_id":"090801a7-83fa-442b-ae40-c688d96f3212","year":null},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:13.474746Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:3632c2d8a3bec5df8c3f49867f802d3f6b0b617f49d9c008d39aa4adf5d8349e","observation_id":"0b79ff21-5b4d-459d-8fac-6cb437bf2369","resolution":{"observed_at":"2026-08-07T14:39:14.715905Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:14.478777Z","title":null,"venue":null,"work_id":"01441661-d0b3-44fb-9896-327168823127","year":null},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:13.629376Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:a44854ee107f97a83af1d9396313e3b793c68cc76133768a56dc17d270bb9122","observation_id":"0fa3e84a-56c3-4942-a4a8-81a4a20ccb57","resolution":{"observed_at":"2026-08-07T14:39:14.567364Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:14.234504Z","title":"While DualTalk ex- cels in creating synchronized and natural two-speaker con- versations, it cannot yet handle multi-party interactions, which are common in real-world applications","venue":null,"work_id":"e374c0b7-a68a-41dd-89a5-7a48272a7c2f","year":null},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:13.746751Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:3641340934a0e9b320f3615d040db9e7bbed31e7e06aaf55a19b93cde365728b","observation_id":"0bef61ec-2aa8-4f8d-9050-f704ba02b849","resolution":{"observed_at":"2026-08-07T14:39:14.318967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:15.048746Z","title":"The decoder follows a similar structure but includes additional cross- attention layers to integrate information from both speakers","venue":null,"work_id":"757be4c1-e20d-4846-bb9d-5bcd955cc2a4","year":null},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":512,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:13.227145Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:47789fc32b25f4ea42c2545795c149b7bd4adceae679bd55fdaa1ae2ed8c9c51","observation_id":"483660ca-40fb-420d-be30-2d4a6a2692a7","resolution":{"observed_at":"2026-08-07T14:39:15.192741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T20:52:41.840051Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":1,"verified_fuzzy":39},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2505.18096."}