{"as_of":"2026-08-19T18:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:884f0cf512b3e19157c8553b0c3c53ff7ab3114251355e1bea5e70f3dff86e52","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T05:00:11.354369Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.21718/citation-record","integrity":"/paper/2504.21718/integrity","json":"/paper/2504.21718/citation-record.json","paper":"/paper/2504.21718"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:14.188368Z","title":"Facetalk: Audio-driven motion diffusion for neural parametric head models","venue":null,"work_id":"3ba27984-cec6-44a8-85a2-a63266159bcb","year":2024},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:10.647115Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:af4e177800811adcdaa67528727428cf7393124a11fd822b5aa0bac6f1072b37","observation_id":"11052c50-5b9c-4368-bb20-e7ddcd658c03","resolution":{"observed_at":"2026-08-16T05:00:14.196598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:14.159381Z","title":"On the challenges and opportu- nities of physically situated dialog","venue":null,"work_id":"cc34cc78-37e5-4853-b213-aa820cac0b2d","year":2010},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:10.664607Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:b6a6794fea4e97edcaac77d8cbd655c8adc295b557ca15f8afb44df7cb5a1768","observation_id":"69e10463-1475-40a0-ad0b-77dd261f720c","resolution":{"observed_at":"2026-08-16T05:00:14.166038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:14.128983Z","title":"Facilitating multiparty dia- log with gaze, gesture, and speech","venue":null,"work_id":"2fa8491b-3464-4903-b4bc-59a96f5a52bf","year":2010},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:10.683881Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:8c4f0fcb0193c6ef90db3ec5ce1487228cdae2c82dac77b74440ecf0fc9c45a8","observation_id":"c2be071f-9a08-423a-9386-390d1e2e0156","resolution":{"observed_at":"2026-08-16T05:00:14.136820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:14.072724Z","title":"Libreface: An open-source toolkit for deep facial expression analysis","venue":null,"work_id":"450e7a5d-ec91-456a-bc4b-532464459817","year":2024},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:10.710214Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:c92213b903aa8e028ba74b19fb51cf65cb307f3ef3bc67acae6564ee52f19a2e","observation_id":"86bafd4e-8131-45ba-8035-8ad5f9291e39","resolution":{"observed_at":"2026-08-16T05:00:14.086776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:14.014071Z","title":"Us- ability and responsiveness of artificial intelligence chatbot on online customer experience in e-retailing","venue":null,"work_id":"8f95ee90-e918-4cc2-b1e7-16aa1dfcd184","year":2021},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:10.733865Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:f51ea710a8505a91e93bbd043837bc62ff25c82b014745dedd0757f0e73c0b59","observation_id":"57a75beb-773c-4579-9035-08f171b1aee6","resolution":{"observed_at":"2026-08-16T05:00:14.023429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:13.974269Z","title":null,"venue":null,"work_id":"e90fed0b-453d-4d94-8609-537e387844ed","year":2016},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:10.745386Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:ff800a0a4c9621b7847ce9b96c113dd1e690cff84867574f94a04a58b87f21b1","observation_id":"54fc0aa6-d150-42d5-91bb-3ad2321cbdd8","resolution":{"observed_at":"2026-08-16T05:00:13.986684Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:13.926093Z","title":"Out of time: auto- mated lip sync in the wild","venue":null,"work_id":"cc729452-58ac-43f8-94a2-0aa38e8125a5","year":2016},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:10.761303Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:b24beec69fd4703ec6e0d0ca164397c18676e114c7c2aafa5d34f0ef5d808bad","observation_id":"ead78a83-1883-46d7-9677-c313c7e0eb26","resolution":{"observed_at":"2026-08-16T05:00:13.936563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:13.892754Z","title":"Capture, learning, and synthe- sis of 3d speaking styles","venue":null,"work_id":"2c9108a6-2198-453c-9a2f-4e537780b903","year":2019},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:10.773734Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:d9e6cb6ce410e612f689a0403377d542875ee928c1a8927e7de434246918fc6e","observation_id":"2d0f400a-ff1e-4e5d-bdf3-d8635e6dd794","resolution":{"observed_at":"2026-08-16T05:00:13.904124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:13.872505Z","title":"Emoca: Emotion driven monocular face capture and animation","venue":null,"work_id":"1555b890-eadd-467e-bbbb-9f600bf58333","year":2022},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:10.792908Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:d13b7f5307b7dc1f881d7e20d274d2462e7c10d3c7ee0e4b1a4eef098ab6c589","observation_id":"a7c7ff17-a182-449c-b765-2322aea258bb","resolution":{"observed_at":"2026-08-16T05:00:13.878069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:13.841756Z","title":"Emotional speech-driven animation with content-emotion disentangle- ment","venue":null,"work_id":"8535ad14-1680-44b2-bbb7-96c81339b689","year":2023},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:10.802904Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:114f077bf54fd17c47916a6ad090b6296c67b89099003a905458d1646cad0d8b","observation_id":"b87afe44-ba04-4c41-bf33-09365436be6e","resolution":{"observed_at":"2026-08-16T05:00:13.850023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:10.819204Z","title":"A survey of embodied ai: From simulators to research tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:10.819204Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:a03d95e839515a30cb4deb038ad7fc57206feb9c5813b1cf22de6be9ff61f742","observation_id":"26caec1e-9e9c-4276-8c62-622d8c0d74ea","resolution":{"observed_at":"2026-08-16T05:00:10.819204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:10.831297Z","title":"Facial action coding system","venue":null,"work_id":null,"year":1978},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:10.831297Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:3d3f1d8155d4d0d73c275d503138ecd64a0fa765dd0a0258f708fd0df07a4b78","observation_id":"bf9e8299-0a87-44d7-b202-a13943f2e38a","resolution":{"observed_at":"2026-08-16T05:00:10.831297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:13.719862Z","title":"Studying human robot interaction and its characteristics","venue":null,"work_id":"343d77a6-2fd4-473e-9c31-b35ffb950f4d","year":2022},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:10.845930Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:edead0ea75b0f0167becb5f2d01c77b731539b35871b5cde22a058db98d8db33","observation_id":"52528e96-88be-4ad7-844f-0747ac8ef416","resolution":{"observed_at":"2026-08-16T05:00:13.726650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:13.688364Z","title":"for real","venue":null,"work_id":"77470fee-ce26-466a-ae1f-5f8286759bb6","year":2021},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:10.860070Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:66c5f3999030953386e79762bd3f7482d5fe8ec83b8064b9bca3369a201dc0ec","observation_id":"a9ea1f5f-b612-4ccd-bb78-bade98106322","resolution":{"observed_at":"2026-08-16T05:00:13.702772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.10939","last_updated":"2023-01-26T05:00:09Z","snapshot_observed_at":"2026-08-18T09:43:51.776960Z","submitted_at":"2023-01-26T05:00:09Z","title":"Affective Faces for Goal-Driven Dyadic Communication","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.10939","snapshot_observed_at":"2026-08-16T05:00:10.877799Z","title":"Affective faces for goal-driven dyadic communication","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:10.877799Z"},"links":{"cited_paper":"/paper/2301.10939","citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:4082173f07aaac6396a41e7e8e27deca7d8b83aa2a404abc078a22553aea6592","observation_id":"f0b2af32-f95b-4aed-ae26-52916c115213","resolution":{"observed_at":"2026-08-16T05:00:10.877799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:13.632461Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":"181ad8a6-14c4-448b-81e5-45dde9ae7de6","year":2017},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:10.887789Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:e0703f12535ef86a29268e68a857c0e5b5f93574b337daffbd1b0906f4308186","observation_id":"77269df6-7368-4592-971f-d714923738aa","resolution":{"observed_at":"2026-08-16T05:00:13.647531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:10.909601Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:10.909601Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:bf82be420af44e2d299db54d46673fddcbaf66b777562bbaa8635fd87b2e302a","observation_id":"5dc20c7c-26c7-49fd-b525-61c7c9b53e20","resolution":{"observed_at":"2026-08-16T05:00:10.909601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:13.563052Z","title":"Arbitrary style transfer in real-time with adaptive instance normalization","venue":null,"work_id":"fc31c44e-b71c-4bc8-84f9-4c942dc0fb09","year":2017},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:10.917650Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:5c89a84b56547167108c9a5db8061cfba6184c8abfe80da2f61e09310098d785","observation_id":"91e157f1-14bc-4d86-82cd-8ec793210913","resolution":{"observed_at":"2026-08-16T05:00:13.576870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:13.524769Z","title":"Dyadgan: Generating fa- cial expressions in dyadic interactions","venue":null,"work_id":"ff4c49ad-95ea-4f71-99f4-55fe28b44a67","year":2017},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:10.935579Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:41b23d2511ec3a77ae432d6f876c06b810954966299d01405685f79144aac2ff","observation_id":"2a50c6e1-45f4-4a6b-89a6-30b08b94cda9","resolution":{"observed_at":"2026-08-16T05:00:13.534549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:10.956819Z","title":"Gradient-based learning applied to document recog- nition","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:10.956819Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:67bdc0efa5600151536d804ea9c75638a757ab1ebaeb33d1cd7544fee01dd2c8","observation_id":"2ab53fd7-b2d7-4a7f-b795-1bd658e8f52e","resolution":{"observed_at":"2026-08-16T05:00:10.956819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:13.418512Z","title":"Learning a model of facial shape and expression from 4d scans","venue":null,"work_id":"3a974369-ebd1-4f00-b10c-74d52a4698f8","year":2017},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:10.972613Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:b389a2b96b167c4c79060ebf486627837af47de8dd64e57536d0488a5c744cb7","observation_id":"6008833b-199a-47e2-b794-d8e1a8325f3a","resolution":{"observed_at":"2026-08-16T05:00:13.473076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:13.385722Z","title":"Visual instruction tuning","venue":null,"work_id":"8f5f3c07-e734-4fff-a91b-a2af1e5bdbd0","year":2024},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:10.983099Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:539c9a4a46f30ac5c3ea63ffec12cd5bae6e874f3a9913e56500190f8490216f","observation_id":"d4f4a457-e7c1-4798-9576-3f183f0bffe4","resolution":{"observed_at":"2026-08-16T05:00:13.392886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:10.989657Z","title":"Mfr-net: Multi-faceted responsive listening head generation via denoising diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:10.989657Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:a3e911013d0554c9e3f8dd4b5309327160ac95b0d401794ac0a9741acdccb058","observation_id":"fa5f69c3-c821-4684-b61d-749a683c9cc0","resolution":{"observed_at":"2026-08-16T05:00:10.989657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:13.326049Z","title":"Customlistener: Text-guided responsive inter- action for user-friendly listening head generation","venue":null,"work_id":"57fbece6-beec-4c88-863f-f75fd62cfb45","year":2024},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:10.997165Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:2feace241e7ef89f573c12754c1e151e3146649f1a55eb12858ddb672abb51ee","observation_id":"dc73003a-6921-4756-b0e2-c7c3ab2edf7b","resolution":{"observed_at":"2026-08-16T05:00:13.345395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-16T05:00:11.006310Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:11.006310Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:f39393da491b454b8fe0f27bef2500a09ccb049a306ef93ca77c9a28c897e8b5","observation_id":"133d583f-9512-415e-be7b-307973c3d222","resolution":{"observed_at":"2026-08-16T05:00:11.006310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:13.283229Z","title":"Automated measurement of facial ex- pression in infant–mother interaction: A pilot study.Infancy, 14(3):285–305, 2009","venue":null,"work_id":"b3c9930d-8b2d-4142-8cd6-e9a0e03e583b","year":2009},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:11.015129Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:4c071e42e114e2d3cd89ffa54d06e325fa6d2094b0f30990df86e662685603d4","observation_id":"e7d314fb-6f26-4d0d-9ccb-32397977bbe3","resolution":{"observed_at":"2026-08-16T05:00:13.293449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:13.245495Z","title":"Learning to listen: Modeling non-deterministic dyadic facial motion","venue":null,"work_id":"282bcb9b-b040-4947-87b5-48c33587677b","year":2022},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:11.024041Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:da3ce5a336dbf29a25b1ee3d46814f01d2540dc406e9b26b85a95384ea4f5611","observation_id":"e220ded1-7e18-4229-8ef8-44f873769488","resolution":{"observed_at":"2026-08-16T05:00:13.253271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:11.037246Z","title":"Can language models learn to listen? In Proceedings of the IEEE/CVF In- ternational Conference on Computer Vision , pages 10083– 10093, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:11.037246Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:9bcb81c67ac52f823d78cabdae9bdd00e78302af8e3c260d058bd173e41491c6","observation_id":"94cf6cff-8b11-42a1-bb6e-e1627ca17049","resolution":{"observed_at":"2026-08-16T05:00:11.037246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:11.062905Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:11.062905Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:85ffe2c304f4a1ceb4d556583a1ca1f5fdd5633fd3cd54456e888a4b05b807f2","observation_id":"f4c9052f-61f4-4195-88c1-57fca4cb7668","resolution":{"observed_at":"2026-08-16T05:00:11.062905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.09092","last_updated":"2018-01-30T19:02:43Z","snapshot_observed_at":"2026-08-19T08:47:31.164063Z","submitted_at":"2018-01-27T14:01:17Z","title":"Interactive Generative Adversarial Networks for Facial Expression Generation in Dyadic Interactions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.09092","snapshot_observed_at":"2026-08-16T05:00:11.071744Z","title":"Interactive generative adversarial networks for facial ex- pression generation in dyadic interactions","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:11.071744Z"},"links":{"cited_paper":"/paper/1801.09092","citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:466939540084584ce8f84668a93f6ae3ec201035d694d2a61ed9319788644b45","observation_id":"37a20fcd-a049-4c31-854b-caa0b7d91809","resolution":{"observed_at":"2026-08-16T05:00:11.071744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:11.078129Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:11.078129Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:650866392c675c83e6db89ed1b56baee4252a9d8bc83b2aa3520edeb25b8b419","observation_id":"e5d4972b-7802-4113-b013-61614c9231bc","resolution":{"observed_at":"2026-08-16T05:00:11.078129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:11.085275Z","title":"Deepfake generation and detection: A benchmark and survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:11.085275Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:79c594894338b97eed6e77c1f654124af5e91a8790d6cf327d85648038e031e6","observation_id":"27edae4c-e825-44a0-b3c6-5fe5752aaba3","resolution":{"observed_at":"2026-08-16T05:00:11.085275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:11.092405Z","title":"Emotalk: Speech-driven emotional disentanglement for 3d face anima- tion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:11.092405Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:9cb27b0e0e725d95a1c5a27bfcbdc66af44a7dd70cfb6070bf1d2382e9c9bb54","observation_id":"6831dd92-b20f-4167-8e62-8155f217adc7","resolution":{"observed_at":"2026-08-16T05:00:11.092405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:13.073672Z","title":"Emotiongesture: Audio-driven diverse emo- tional co-speech 3d gesture generation","venue":null,"work_id":"881cb848-7290-48d7-ab31-8e30edddefaf","year":2024},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:11.098680Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:45e45f010538802709856923d27b7a229b3776b8c1f0c6faf560978ee9dde096","observation_id":"ba468625-a194-4145-8412-3092fe7b882a","resolution":{"observed_at":"2026-08-16T05:00:13.082449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:13.001306Z","title":"Weakly-supervised emotion transition learning for diverse 3d co-speech gesture generation","venue":null,"work_id":"2492bbd1-d48f-49b2-8ebe-42dbc19e35dc","year":2024},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:11.106685Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:eb96a740cc86e2bb898d0489770cb5e75d78f370bd273ea9f1f7e84e7b109ac7","observation_id":"27cedaf2-6692-4ad9-ae37-ac8677dacbc5","resolution":{"observed_at":"2026-08-16T05:00:13.010525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16874","last_updated":"2025-04-25T09:26:36Z","snapshot_observed_at":"2026-07-06T18:20:22.759333Z","submitted_at":"2024-05-27T06:47:14Z","title":"CoCoGesture: Toward Coherent Co-speech 3D Gesture Generation in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16874","snapshot_observed_at":"2026-08-16T05:00:11.115102Z","title":"Cocogesture: Toward coherent co- speech 3d gesture generation in the wild","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:11.115102Z"},"links":{"cited_paper":"/paper/2405.16874","citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:075232645a5f5b8ce9f4104b0c4617119706bb2b788d72d87be6dd8a6df50e86","observation_id":"268a7236-f29e-49dc-bdbd-ac9ac9699f48","resolution":{"observed_at":"2026-08-16T05:00:11.115102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:12.962830Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"5d42846d-088e-4f83-a719-4b0739ca3cfe","year":2021},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:11.124172Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:e92835716712025e4d9b5103808572e348461b51086a0065e0ebff84f32a43d8","observation_id":"41ca3b71-2927-4f6c-9bfa-e7d9d473fb5b","resolution":{"observed_at":"2026-08-16T05:00:12.978281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:12.924443Z","title":"Meshtalk: 3d face an- imation from speech using cross-modality disentanglement","venue":null,"work_id":"607b873e-2239-416b-974a-64ee48fe6fb4","year":2021},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:11.133319Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:a98525a5c7e0e5be9b7b4a8b65c15d070246d7b2ed08dffd99b0695ee3c7a6dd","observation_id":"344704e7-b287-48db-af3e-f3bfff8d9971","resolution":{"observed_at":"2026-08-16T05:00:12.933022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:12.882609Z","title":"Quantifying facial expression synchrony in face-to- face dyadic interactions: Temporal dynamics of simultane- ously recorded facial emg signals","venue":null,"work_id":"08d76bf7-2849-41b5-aa83-a295816ed1fc","year":2017},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:11.142188Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:57aeed7ee81c0d9b94309ed0d7c0b6ce8668d22e4bc6be50bf514b1ea9deae26","observation_id":"b35b30f4-0945-4fbe-baf1-87ce0f0e405e","resolution":{"observed_at":"2026-08-16T05:00:12.894686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:12.847070Z","title":"A circumplex model of affect","venue":null,"work_id":"23e98cb1-1903-45bc-a8bf-f6f0204b2823","year":1980},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:11.149565Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:eb1d6675443ce1ff6593bc05d56a0dfbf53f89e27152889cfae0e59b8e5a79be","observation_id":"455c3b56-d068-4fa0-81e8-2624ea53531a","resolution":{"observed_at":"2026-08-16T05:00:12.855289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-16T05:00:11.157904Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:11.157904Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:13e7540887eb84563d4fa5e49b33b107d728b06821848df2361e51f237f11a86","observation_id":"9603134e-b518-4dc5-b07c-62ed96edf06e","resolution":{"observed_at":"2026-08-16T05:00:11.157904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:12.810373Z","title":"Emotional listener portrait: Neural lis- tener head generation with emotion","venue":null,"work_id":"faeb769a-b718-4c48-8116-721247a0f162","year":2023},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:11.169039Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:3225a24b49183a439a1f478dc74a7cdb65b61e7f8d1f688b159dd343fcbadbc7","observation_id":"fb0d6c2c-861c-48a9-bed6-22f8d908cd8a","resolution":{"observed_at":"2026-08-16T05:00:12.820123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:12.754570Z","title":"A con- versational agent framework with multi-modal personality expression","venue":null,"work_id":"b46d0200-35f6-459d-9d29-f13703637855","year":2021},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:11.178397Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:eedbb1fd73d01df4e90c1ec795102caa81d40338756160c7e3c9a3af20129d13","observation_id":"77716b6b-958a-4cde-a796-326162da239f","resolution":{"observed_at":"2026-08-16T05:00:12.772221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:12.694495Z","title":"Artificial intelligence, machine learning and deep learning in advanced robotics, a review","venue":null,"work_id":"b5c9cc3d-5b36-4a8f-b467-098d28191c5b","year":2023},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:11.185761Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:aac3eb7b4bde301383bf56b8bf81d7c60c09b1c2327730626253b55ae76cab34","observation_id":"cd226d1b-3117-4fc2-b790-4394809254a9","resolution":{"observed_at":"2026-08-16T05:00:12.721129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:12.655756Z","title":"Analyzing human– human interactions: A survey","venue":null,"work_id":"46fe6f8a-37f5-4721-87f5-43c412b3b25a","year":2019},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:11.192971Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:2699b200166538d7270106de182fd6fad504419a5e4dd850eba5fc2ec34cb138","observation_id":"5d05e84d-d8e5-473f-bdc2-64f04132c080","resolution":{"observed_at":"2026-08-16T05:00:12.664218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:12.408802Z","title":"Avi-talking: Learning audio-visual in- structions for expressive 3d talking face generation","venue":null,"work_id":"942697c6-00f4-4930-984c-8cea23a25845","year":2024},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:11.202100Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:21c7966c26901653e9674008b06ca8ff8af2e6c5d0c6d2acbc8b9b79cb64378a","observation_id":"7e81b087-0169-4800-845e-a8c71ebf0a97","resolution":{"observed_at":"2026-08-16T05:00:12.635576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:12.366950Z","title":"Diffposetalk: Speech-driven stylistic 3d facial animation and head pose generation via diffusion models","venue":null,"work_id":"250835b3-8b46-4a6f-82ee-9d5ad02e3c28","year":2024},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:11.209316Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:120521b511d6897f7edb0a272cbc29ad01b25690f85403e11071c4313360971a","observation_id":"7da6a430-c4c4-4e48-96c1-7f3d181a41fe","resolution":{"observed_at":"2026-08-16T05:00:12.377967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:12.333513Z","title":"Listen- ing head motion generation for multimodal dialog system","venue":null,"work_id":"65ab2f92-58e8-4e34-85bf-b3663400d42a","year":2024},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:11.217844Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:aa798c7a7778d6d2aaecb670ee3ab6b362c576c1c11ff15036b198d8290e0750","observation_id":"a4dd25e5-b010-4179-b6d1-4437b600232b","resolution":{"observed_at":"2026-08-16T05:00:12.341819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:12.291373Z","title":"Imitator: Personalized speech-driven 3d facial animation","venue":null,"work_id":"d767dd83-e3f3-4226-a2b6-57e1d516e219","year":2023},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:11.234959Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:fa5c37dcfcd56b0cf379da3632fa008371177862e9bf14d43dbaef01f1b885b6","observation_id":"a870529d-112d-4360-96d1-949cdd43fcfc","resolution":{"observed_at":"2026-08-16T05:00:12.300406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:12.261636Z","title":"Estimation of continuous va- lence and arousal levels from faces in naturalistic conditions","venue":null,"work_id":"c3cc2b65-bcef-47f1-be4f-f6b0cbb207d1","year":2021},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:11.243101Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:529463f829bb3aced12e751d7c284eef740505f50a5756d90188bfa13c4b4e21","observation_id":"de91a6b4-a88a-4e2f-9b9b-8e95adfd8bfd","resolution":{"observed_at":"2026-08-16T05:00:12.269947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:12.216401Z","title":"Dim: Dyadic interaction modeling for social be- havior generation","venue":null,"work_id":"41206b4e-8719-4bfe-bd38-0a9e841bfa11","year":2024},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:11.258044Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:1603082a481308e165a9c1a60427c76ace58c435d2642698f0df4d2ca78d3246","observation_id":"c74135e3-8fca-4eb4-b87f-22644a5a08db","resolution":{"observed_at":"2026-08-16T05:00:12.230779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09069","last_updated":"2024-07-17T21:53:41Z","snapshot_observed_at":"2026-08-16T14:09:58.805440Z","submitted_at":"2024-03-14T03:21:33Z","title":"Dyadic Interaction Modeling for Social Behavior Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09069","snapshot_observed_at":"2026-08-16T05:00:11.269099Z","title":"Dyadic interaction modeling for social behavior generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:11.269099Z"},"links":{"cited_paper":"/paper/2403.09069","citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:2b8e9e4dd64baafca3b35742ea8951acfd372fafd07e2b76a14696c85167bb9a","observation_id":"c1d27f79-3330-4a5f-bc40-e99f6c04e60a","resolution":{"observed_at":"2026-08-16T05:00:11.269099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:11.281840Z","title":"Neural discrete representation learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:11.281840Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:c8f9abcf9eff63c8e50911928feab66b9a7b6bbab2e262a3ddb4de5c4be401bf","observation_id":"9d27516c-26b4-42bb-bcb7-90b98cf80d85","resolution":{"observed_at":"2026-08-16T05:00:11.281840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:12.152810Z","title":"Effects of inter- acting with a crowd of emotional virtual humans on users’ affective and non-verbal behaviors","venue":null,"work_id":"efbd56e0-7fc7-41fe-8758-7122a4489826","year":2020},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:11.296724Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:023a877377c875a90bc6fec01ccec72be5bd3e8d2036bcaf24d4068641a4b05a","observation_id":"3a8875ff-8087-443f-b852-4ba440d245cd","resolution":{"observed_at":"2026-08-16T05:00:12.163347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:12.107200Z","title":"Versa- tile face animator: Driving arbitrary 3d facial avatar in rgbd space","venue":null,"work_id":"ba980c03-4683-4193-a924-7827c81fad19","year":2023},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:11.312863Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:d7300c59c43a3bfddadda37c4003e3b666140ce6626248a712a365e1c108c861","observation_id":"8b475221-0252-4c55-aebe-8f6a5fa49fd2","resolution":{"observed_at":"2026-08-16T05:00:12.120344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:12.077610Z","title":"Speech-driven 3d face animation with com- posite and regional facial movements","venue":null,"work_id":"41c06801-4919-4841-9e3a-7d8ac7c24a67","year":2023},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:11.322039Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:42e9c89f984802aae4603a067311a3c2b9822f2ecb7021f88e11a8f82318516a","observation_id":"e92475be-5550-4bf5-88f6-47b6d3c6bf26","resolution":{"observed_at":"2026-08-16T05:00:12.086190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.15001","last_updated":"2022-08-31T17:58:54Z","snapshot_observed_at":"2026-08-16T16:35:36.335456Z","submitted_at":"2022-08-31T17:58:54Z","title":"MotionDiffuse: Text-Driven Human Motion Generation with Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.15001","snapshot_observed_at":"2026-08-16T05:00:11.332706Z","title":"Motiondif- fuse: Text-driven human motion generation with diffusion model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:11.332706Z"},"links":{"cited_paper":"/paper/2208.15001","citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:9523d76307b043d8f4b90ce74f86b8d5c0720031f1502ba91761e10239bb50a6","observation_id":"8d9af6a0-db0e-4e47-b410-6dc2ec775601","resolution":{"observed_at":"2026-08-16T05:00:11.332706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:12.037243Z","title":"Media2face: Co-speech facial animation gen- eration with multi-modality guidance","venue":null,"work_id":"38d6c764-6675-4657-9a84-d20f81bc1f10","year":2024},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:11.338244Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:4e80f6b4d14f0dc68fb25aa313edea29a7b139583d3c22d9ddbe01e170756352","observation_id":"a73e35c7-7bd1-4e45-b386-f14cf3ef253d","resolution":{"observed_at":"2026-08-16T05:00:12.049094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:11.996952Z","title":"Responsive listening head generation: a benchmark dataset and baseline","venue":null,"work_id":"503e2746-31e1-4378-a216-5112c494fd95","year":2022},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:11.345532Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:ac14bd3c9ecb4170a2c7753cb322750de4e9ce1ec29a70313b69b7537619ee04","observation_id":"b698f257-03c0-4a82-b767-8aff0c9e65b7","resolution":{"observed_at":"2026-08-16T05:00:12.004407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:00:11.960117Z","title":"To your family and nation, being a trickster is destructive, but it’s like finding God in freedom","venue":null,"work_id":"deedb09e-42ba-4347-986f-1ea4675a357d","year":null},"citing_paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:11.354369Z"},"links":{"citing_paper":"/paper/2504.21718"},"observation_digest":"sha256:6b18da3409c752c8f310fd400c29dfc91a48fe5b0668c2ed18aad73ef2c88a1a","observation_id":"adbedc43-3381-4d89-88c3-8d6aa603ec1b","resolution":{"observed_at":"2026-08-16T05:00:11.979278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.21718","last_updated":"2025-05-07T02:35:50Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T08:47:37.734721Z","submitted_at":"2025-04-30T15:05:12Z","title":"VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":41},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2504.21718."}