{"as_of":"2026-08-19T08:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:74f0839054905f65433ba58fa3c228368fd4ac376a5b399c41b8b2c2f6d80e61","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:11:01.223944Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01643/citation-record","integrity":"/paper/2608.01643/integrity","json":"/paper/2608.01643/citation-record.json","paper":"/paper/2608.01643"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.344842Z","title":"ACM Transactions on Graphics (TOG)42(4), 1–20 (2023)","venue":null,"work_id":"d88bcd3f-330e-4e46-b58e-751730f7e89d","year":2023},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:00.965741Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:a7c0f5a51acea301b058e93fa5d46643825d86c3ef3522f42f6e0a11e4a4c224","observation_id":"f231a1f8-89c1-42da-837b-44a3fce8a300","resolution":{"observed_at":"2026-08-15T15:11:02.348417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.332892Z","title":"ACM Transactions on Graphics (TOG)42(4), 1–18 (2023)","venue":null,"work_id":"0e303fe3-812d-47d5-b1f6-07ad43d41268","year":2023},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:00.969856Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:394f240c8b13c170b7f41b785d97e340bfb1be73f703258c47b47d27ae62aa36","observation_id":"ba958df2-c5ae-4a1d-a856-98cb0fd4ecd2","resolution":{"observed_at":"2026-08-15T15:11:02.336528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:00.973790Z","title":"In: 2022 International Conference on 3D Vision (3DV)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:00.973790Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:2f6a754088cc3839551874b100304932c49f1749851037401b0b41546da556c3","observation_id":"ece61bbe-4283-40dc-b2e5-5a9e8cc7eeb2","resolution":{"observed_at":"2026-08-15T15:11:00.973790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.312513Z","title":"In: Proceedings of the 32nd ACM International Conference on Multimedia","venue":null,"work_id":"63d1a773-832e-4d57-81b3-b194eeff9ecb","year":2024},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:00.977519Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:a5d4b0b45910fdc1f95df3f7ff943dfa676a7e7e6b7f7f4dbffc20075920f01b","observation_id":"c314608e-f80f-40da-843b-deb89553bd74","resolution":{"observed_at":"2026-08-15T15:11:02.316102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.21904","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.703970Z","title":"arXiv preprint arXiv:2601.21904 (2026)","venue":null,"work_id":"3e436548-5450-437d-8ecb-841245baa4d3","year":2026},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:00.981512Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:94cd12afd50b5041b83589d12f4bbc5c3a9070b8c9a9e47b5e60cbab5dcb8f77","observation_id":"e64a283c-2821-456f-a5ed-3cf4e95c6efb","resolution":{"observed_at":"2026-08-15T15:11:01.710776Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.300336Z","title":"In: Proceedings of the 33rd ACM International Conference on Multimedia","venue":null,"work_id":"f13dea17-2ef1-4430-942e-60c845618e4c","year":2025},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:00.985110Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:097961552da899fee356c4eca8cf672992c44957bfea7229f07c29a9dfddeaf9","observation_id":"3760eca4-e2ed-4292-a9c0-bdb7b16a9019","resolution":{"observed_at":"2026-08-15T15:11:02.304191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.287459Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"5f556add-9cae-4d9d-9780-2e06152e749a","year":2024},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:00.989348Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:87b9ea28eca11f366cf41ad7f0f2b6a548e476c9fbedb5b9c71ba2f1821c5210","observation_id":"3a6ceb81-def2-4807-afd2-2aaf7b03539c","resolution":{"observed_at":"2026-08-15T15:11:02.291247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.275296Z","title":"IEEE Journal of Selected Topics in Signal Processing16(6), 1505–1518 (2022)","venue":null,"work_id":"d17d4f3d-755a-4911-a92d-f47ec94dad60","year":2022},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:00.993341Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:b75b384317d9d9458f5ccd20090a80eddde8ef542a75e4b1ebcad15009822a2c","observation_id":"a3f798fd-f825-424a-94a9-a599b8ce95f6","resolution":{"observed_at":"2026-08-15T15:11:02.279215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.08729","last_updated":"2026-06-29T11:45:55Z","snapshot_observed_at":"2026-08-12T18:43:13.847795Z","submitted_at":"2026-05-09T06:32:54Z","title":"Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.08729","snapshot_observed_at":"2026-08-15T15:11:00.997153Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:00.997153Z"},"links":{"cited_paper":"/paper/2605.08729","citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:661a0d856a5072a94d6ed89ad1fdac0d8a3052f998abebabd377c4d7dd0a2810","observation_id":"c14cbf7d-37e6-46ac-a6e1-0cc9aeef611d","resolution":{"observed_at":"2026-08-15T15:11:00.997153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.36323","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.623298Z","title":"IEEE Transactions on Circuits and Systems for Video Technology36(4), 4550–4564 (2025).https: //doi.org/10.1109/TCSVT.2025.3632359","venue":null,"work_id":"6ae99fcc-2cc2-4f84-84da-6be91b177f12","year":2025},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.001193Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:56130281924bb9be05e598ed8a9ee0bc5546a114c92ab12b4bf3f68cd5b975e6","observation_id":"09e53e62-e6ce-4c53-a459-3d4c49a54798","resolution":{"observed_at":"2026-08-15T15:11:01.629829Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13229","last_updated":"2025-03-17T14:42:31Z","snapshot_observed_at":"2026-08-18T06:45:54.895248Z","submitted_at":"2025-03-17T14:42:31Z","title":"HoloGest: Decoupled Diffusion and Motion Priors for Generating Holisticly Expressive Co-speech Gestures","version":1},"cited_work":{"arxiv_id":"2503.13229","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13229","snapshot_observed_at":"2026-08-15T15:11:01.549274Z","title":"HoloGest: Decoupled Diffusion and Motion Priors for Generating Holisticly Expressive Co-speech Gestures","venue":"cs.CV","work_id":"21804a07-b78b-44b9-bed3-5bce1dcf6df2","year":2025},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.004675Z"},"links":{"cited_paper":"/paper/2503.13229","citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:608bfb4b406b667b9c7e05afdf72b0cd08e2b482bdc1f86555764b967e72d4cf","observation_id":"a025ef98-ebc0-43af-9879-3819e9a4335d","resolution":{"observed_at":"2026-08-15T15:11:01.552966Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.262792Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"b7a275ce-f93e-42d2-affe-252bf6b2d0e2","year":2024},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.008523Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:a02f99c329f8be18ac2c315fcb0e2676a7baf93c03da2fd628371fe503f46fba","observation_id":"2fbf7431-5d0f-439b-904a-aef1fa3d6941","resolution":{"observed_at":"2026-08-15T15:11:02.266879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.250707Z","title":"In: Proceedings of the 21st ACM International Conference on Intelligent Virtual Agents","venue":null,"work_id":"42c50c90-1e8a-40f2-a82e-8179def7b402","year":2021},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.012092Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:d060b5e4ede2fc7e720e1a308167ee80263b58f4145ed7f1256fdfb26634ac13","observation_id":"cbd23129-9630-4464-a317-5f989bb28840","resolution":{"observed_at":"2026-08-15T15:11:02.254365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.238723Z","title":"ACM SIGGRAPH Computer Graphics21(4), 215–224 (1987)","venue":null,"work_id":"8b061d43-b859-4231-8684-07c77054fbd1","year":1987},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.015298Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:a7c139f7d3db15cdfb15b65aa50ebd5bf8c6397d511d583d29c57e1c961fca6f","observation_id":"78edb32b-1af9-4970-aa92-ba7bef1c3e5b","resolution":{"observed_at":"2026-08-15T15:11:02.242355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.018640Z","title":"In: Proceedings of the IEEE/CVF conference on com- puter vision and pattern recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.018640Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:1875706479a91150b6040931ea63449b030a30730199ebbd004fbc9c238918d5","observation_id":"80808ac3-8dff-4579-9b22-7571cf8a0d3e","resolution":{"observed_at":"2026-08-15T15:11:01.018640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.217938Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":"c94610d2-fb41-4e01-8aa3-5da7ef8a6cc8","year":2021},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.021885Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:41a34b5ba3b51d921de52cbec27609f49b25facff623543f9237003766e4981a","observation_id":"cac5b2a8-4678-4ffa-92fc-d90df6d8c742","resolution":{"observed_at":"2026-08-15T15:11:02.221988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.206106Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"7a8de860-8ced-4668-a664-5f09eca1df9d","year":2024},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.025201Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:b2b565a13e2d7bf1b0ece04295df9bba78f4531a204ab6756101bb478a2120b1","observation_id":"6a2671c4-49c1-4db9-b2ed-9e0c453ce5a4","resolution":{"observed_at":"2026-08-15T15:11:02.209782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.028620Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.028620Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:19267a486528a71baa49fb83e20327b4c0a1d0a5fe8e4093d8e6d71ddc4c66e2","observation_id":"f0e19a63-a995-4a13-b0ad-d93fc90f18c5","resolution":{"observed_at":"2026-08-15T15:11:01.028620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.05363","last_updated":"2018-07-09T21:23:27Z","snapshot_observed_at":"2026-08-14T20:47:06.603602Z","submitted_at":"2017-07-17T18:45:29Z","title":"Auto-Conditioned Recurrent Networks for Extended Complex Human Motion Synthesis","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.05363","snapshot_observed_at":"2026-08-15T15:11:01.032190Z","title":"arXiv preprint arXiv:1707.05363 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.032190Z"},"links":{"cited_paper":"/paper/1707.05363","citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:1e2f2d9dc89ecde09fa3057b8542d83426e1ef27b270a2256a36ed9ed984d95c","observation_id":"302aa36f-5758-475b-8dd4-0e40d3fd5267","resolution":{"observed_at":"2026-08-15T15:11:01.032190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-16T02:30:42.660030Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-15T15:11:01.036380Z","title":"arXiv preprint arXiv:2210.02747 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.036380Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:5d0c1ff18df3b0643e668c51d4750623b8609f03386973ece0e76afec307d4ed","observation_id":"66e7b7eb-b1cc-4330-8c6b-ca3c1d0915a1","resolution":{"observed_at":"2026-08-15T15:11:01.036380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.185904Z","title":null,"venue":null,"work_id":"2b9dcb7c-6cad-4d39-8021-fac4d176ce6f","year":2022},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.040092Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:58ef692ee625a4c5a4fcf62c8b0ee097eeebe2cfbfef291186956841dea7cd19","observation_id":"7ff06b55-059b-47d7-a51b-7711d5837785","resolution":{"observed_at":"2026-08-15T15:11:02.189539Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.173966Z","title":"In: Proceedings of the StreamTalk 17 IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"457198c5-ba36-4e45-a39c-3dd5751eaf11","year":2024},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.043430Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:d1717c0858a939790610d1b5cb87d328894cf287c5d7ccb665020538c1b95f7e","observation_id":"2e231848-a9df-4c73-9e68-766eccb0460a","resolution":{"observed_at":"2026-08-15T15:11:02.177861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.161358Z","title":"In: European conference on computer vision","venue":null,"work_id":"d59236d5-56f8-4cf0-83c7-155ece9b804b","year":2022},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.047281Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:1cbc12a7a95a9e5cde16d5d1d4aa8cd217b519a6084dd9405227add4830144cc","observation_id":"bc724148-f9a2-4069-a269-415d8e82c9d3","resolution":{"observed_at":"2026-08-15T15:11:02.165358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.147198Z","title":"In: Proceed- ings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":"1a42efc1-3d10-4086-820b-426ca36ca14d","year":2025},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.050621Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:f555a74fc5adf52cbbdec051b4b724ac7e345c9c7781585a244f7e83e64f1cf4","observation_id":"8aa37d98-7373-429d-b6bb-8890e3141b72","resolution":{"observed_at":"2026-08-15T15:11:02.152074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18898","last_updated":"2026-08-15T03:16:14Z","snapshot_observed_at":"2026-08-19T08:12:16.252440Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18898","snapshot_observed_at":"2026-08-15T15:11:01.054073Z","title":"arXiv preprint arXiv:2501.18898 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.054073Z"},"links":{"cited_paper":"/paper/2501.18898","citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:18a9aeeba29c298f3de4dd5a3ecb6d8221fb480261f77744786363b3f7240f61","observation_id":"83c747bf-06e1-44a0-88b9-e0d324969730","resolution":{"observed_at":"2026-08-15T15:11:01.054073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.134325Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"69a846a5-043a-45ac-8e98-24da963722e2","year":2024},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.058343Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:bc43562c5975776b707043d91886efa32158fc358ecd2bdbc090eac0b0e44350","observation_id":"172cefa1-6e5b-4148-8a2b-7c326c9ff909","resolution":{"observed_at":"2026-08-15T15:11:02.137996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.122080Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":"12d502ef-71af-4287-b119-865a367fc63b","year":2025},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.061646Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:c695c8066e606b1243757e309badb78f14e231e28b9b3381fabd5e8b570c017e","observation_id":"2efac800-e169-4cd0-9ab9-3da51c326392","resolution":{"observed_at":"2026-08-15T15:11:02.125915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.104170Z","title":"In: IEEE Conference on Computer Vision and Pattern Recognition (2024)","venue":null,"work_id":"d5d5dcf2-7723-49f6-b3d6-5ca782fbcb45","year":2024},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.065104Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:3608cd59ba16f7a727daca2d484ba3c34bd7d5deb0134e806dcc170b2f9481a8","observation_id":"6f247428-3df1-4fdd-89cd-01e014d5aacc","resolution":{"observed_at":"2026-08-15T15:11:02.109758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.068705Z","title":"arXiv preprint arXiv:2602.18432 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.068705Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:635e3f8b5287141b922af6d011391a3d8a91d720faf1b1e63f013853c4037bad","observation_id":"4e564fe0-bed8-4957-a338-ce6e7fe1677c","resolution":{"observed_at":"2026-08-15T15:11:01.068705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.092186Z","title":"IEEE Transactions on Visualization and Computer Graphics (2024)","venue":null,"work_id":"126f2e95-3b74-4458-b227-c3cc6d16c581","year":2024},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.073022Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:125a6895736884d2ae88adcec37d9a691b2101056f7e2138f456d595be1beb3d","observation_id":"33a83c36-f51d-43e6-8794-40176a44826d","resolution":{"observed_at":"2026-08-15T15:11:02.095859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.076322Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.076322Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:4b64d52d5d7518b415d10333d4e055de13ea2d64a4e36144dae84a82ce22d314","observation_id":"11a82578-a28d-4c20-a860-a9682a674e90","resolution":{"observed_at":"2026-08-15T15:11:01.076322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.080067Z","title":"In: Proceedings of the AAAI conference on artificial intelligence","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.080067Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:1dd59bcb2c8a57b36fc7e05ed32079cd901114aba0a1f895bcaf73d0931f1bb9","observation_id":"c9a055a4-edc4-4fdd-9906-10ef2cd6acd8","resolution":{"observed_at":"2026-08-15T15:11:01.080067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01418","last_updated":"2023-08-30T04:41:10Z","snapshot_observed_at":"2026-08-16T15:51:18.051527Z","submitted_at":"2023-03-02T17:09:27Z","title":"Human Motion Diffusion as a Generative Prior","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01418","snapshot_observed_at":"2026-08-15T15:11:01.083686Z","title":"arXiv preprint arXiv:2303.01418 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.083686Z"},"links":{"cited_paper":"/paper/2303.01418","citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:2be49046b968ad3cf9bf786986de85f174a5672bdbfd051d95732ac6dc178827","observation_id":"990c04d9-6c12-4c4d-b61a-5e309624f8d3","resolution":{"observed_at":"2026-08-15T15:11:01.083686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.22905","last_updated":"2026-06-30T08:27:33Z","snapshot_observed_at":"2026-08-12T18:44:08.929234Z","submitted_at":"2026-06-22T06:41:17Z","title":"InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.22905","snapshot_observed_at":"2026-08-15T15:11:01.087999Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.087999Z"},"links":{"cited_paper":"/paper/2606.22905","citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:b36c2bd9332e49d327f1173c6fb7f42d1f89bf9b3926a252639e81f9df5deebc","observation_id":"c0e3a65d-0e78-47c3-8863-7037ae09bc73","resolution":{"observed_at":"2026-08-15T15:11:01.087999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.063829Z","title":"Advances in Neural Information Processing Systems38, 10947–10969 (2026)","venue":null,"work_id":"fba9d915-beb1-4f94-90ab-f70ba614a231","year":2026},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.091835Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:c7534bd047512fdba76289926f02ac4a45ad5e997287e8feeea80fa65a690488","observation_id":"f963ce7a-d24a-4d1b-af89-070868ffa116","resolution":{"observed_at":"2026-08-15T15:11:02.067738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.095625Z","title":"Advances in neural information processing systems30(2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.095625Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:0cf0a81f3d2aae49ee957d6e26e8ae09af01c35d02b0b592e566bba9bb8370e3","observation_id":"04435ae6-e8f2-4ccf-8aee-950e07f405a4","resolution":{"observed_at":"2026-08-15T15:11:01.095625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13204","last_updated":"2023-11-27T15:19:00Z","snapshot_observed_at":"2026-08-16T16:29:36.469852Z","submitted_at":"2022-09-27T07:10:20Z","title":"NEURAL MARIONETTE: A Transformer-based Multi-action Human Motion Synthesis System","version":2},"cited_work":{"arxiv_id":"2209.13204","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.13204","snapshot_observed_at":"2026-08-15T15:11:01.408938Z","title":"NEURAL MARIONETTE: A Transformer-based Multi-action Human Motion Synthesis System","venue":"cs.CV","work_id":"1ec033e5-e28f-4b0d-a77c-870763cc387e","year":2022},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.099403Z"},"links":{"cited_paper":"/paper/2209.13204","citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:462881c0e9054b31c0d1bc671b7047413fcbea5e25b239f9ab024af7756e4e42","observation_id":"d7929c6f-d660-444a-844a-8e6451f65aef","resolution":{"observed_at":"2026-08-15T15:11:01.412771Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.043208Z","title":"IEEE Transactions on Image Processing34, 7079–7092 (2025) 18 X","venue":null,"work_id":"69731d1a-58c2-4e21-9d88-a26178f32ee2","year":2025},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.103113Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:4e40fd1af8374d58ddd20231813bd1d6528b85368b9ddebf1479ffcc6fb85693","observation_id":"ffd72c74-9de1-414e-9d2b-7d4f6360e723","resolution":{"observed_at":"2026-08-15T15:11:02.047071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.031605Z","title":"In: Proceedings of the AAAI Conference on Artificial Intelligence","venue":null,"work_id":"e6aecbdb-c816-49ed-93c3-654c216ff349","year":2026},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.106561Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:9b663457bb6649c2d5ac936730ae43509c018369d5d559bbf8259b386faaf282","observation_id":"94e84148-1337-4bf0-b4c4-43482ad5be8d","resolution":{"observed_at":"2026-08-15T15:11:02.035087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.019776Z","title":"In: 2023 IEEE/CVF Con- ference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":"20129ec2-715e-491a-b285-2613c2401411","year":2023},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.110221Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:33b1982b0822d99cd577d1d8ef280854b6a42ea10485ce5f16c54ae58367de36","observation_id":"d99d0e86-1dde-4a8a-8023-0b681b120ba3","resolution":{"observed_at":"2026-08-15T15:11:02.023888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.007942Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"063a9b69-256c-4794-8c00-d1fbb8177d71","year":2026},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.113422Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:e78f7b6a7df3aaab65498d783d1eacf93d243baec63d02a0f77eb1a4dca605c4","observation_id":"07f28ff5-512b-4ee9-b97b-72f5e7407ed0","resolution":{"observed_at":"2026-08-15T15:11:02.011595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.996285Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":"7b8dc63d-6c3d-4fe0-a936-cadfc50f00da","year":2025},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.117111Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:d15910c50bb30eca8112f8c755df8fbf15b7407c9b11bb2528bfbed42ce3f223","observation_id":"5ebb00ff-6fa0-4867-8925-78e8843a4539","resolution":{"observed_at":"2026-08-15T15:11:01.999883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.983735Z","title":"Advances in Neural Information Processing Systems37, 20055–20080 (2024)","venue":null,"work_id":"7133484b-af39-45ca-8b83-cbb366263cbb","year":2024},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.120616Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:3dd77f4bf92486f821faac636ab4b6c8e246d7175dcd5fa3cbf7a00129b7940c","observation_id":"a49d6001-349b-4366-b330-9ed282dd3ce6","resolution":{"observed_at":"2026-08-15T15:11:01.987791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.972729Z","title":"In: Proceedings of the 2024 International Conference on Multimedia Retrieval","venue":null,"work_id":"9010818e-d0c0-4dcf-b2de-c6af895a3f54","year":2024},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.124144Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:498e9bae8df9effbf6cdffe4651ed08cfe79d929ea8521c574905f2924a7ffe3","observation_id":"6611e9f4-e1d4-47e4-a71b-5f7a32136958","resolution":{"observed_at":"2026-08-15T15:11:01.976092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21029","last_updated":"2026-06-22T20:04:30Z","snapshot_observed_at":"2026-08-17T12:37:17.424517Z","submitted_at":"2025-11-26T03:53:10Z","title":"FlowerDance: MeanFlow for Efficient and Refined 3D Dance Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21029","snapshot_observed_at":"2026-08-15T15:11:01.127888Z","title":"arXiv preprint arXiv:2511.21029 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.127888Z"},"links":{"cited_paper":"/paper/2511.21029","citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:0dbcce45cf8081d5ac23ce17dfe733fbe8ad2da9904d6b9a9b6a2d4c0b20de8a","observation_id":"d283c3f8-0dc1-4c15-aaa1-bce6bddb0bee","resolution":{"observed_at":"2026-08-15T15:11:01.127888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.960923Z","title":"In: Proceedings of the 33rd ACM International Conference on Multimedia","venue":null,"work_id":"4b687110-86c7-4e71-8694-d9d4973fd253","year":2025},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.132084Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:8c4b479e5e41825c717f20d51c04d0c8487a38ad292c2575454deb89081fde3c","observation_id":"0359ee78-6588-4c50-b455-93edeaa87be8","resolution":{"observed_at":"2026-08-15T15:11:01.964575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.949327Z","title":"In: Proceedings of the 2024 International Conference on Multimedia Retrieval","venue":null,"work_id":"31296b32-4c07-41c0-984d-22ab73169210","year":2024},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.135950Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:2f47337b2f5c2fcfd1637eef321e9cb84b35eb13f0add4d6f25ed06e9bba567d","observation_id":"81e7362a-1ef9-4763-8f08-3b95f075895c","resolution":{"observed_at":"2026-08-15T15:11:01.952923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-15T12:28:20.577447Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.30019","snapshot_observed_at":"2026-08-15T15:11:01.139474Z","title":"arXiv preprint arXiv:2606.30019 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.139474Z"},"links":{"cited_paper":"/paper/2606.30019","citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:a5f8a3b87fb9bcddafd682338eb8d2bc678ec205908d125591d991f6e2f1fdef","observation_id":"145fb874-0cbb-4558-8921-d90b8e7ac17f","resolution":{"observed_at":"2026-08-15T15:11:01.139474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.936313Z","title":"In: Proceedings of the Special Interest Group on Com- puter Graphics andInteractive TechniquesConference Conference Papers.pp","venue":null,"work_id":"22a96e93-e414-4500-9341-341bb3039071","year":2026},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.142867Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:8a6cfbd41e594981d0db6de2c4014c19ba2db234dc3b430f11044fef13cc4d29","observation_id":"1fb09e43-932f-4456-a140-0c928d4583ee","resolution":{"observed_at":"2026-08-15T15:11:01.941033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.923782Z","title":"arXiv e-prints pp","venue":null,"work_id":"73f2a9bf-92a7-4219-be48-5e47e28938ff","year":2023},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.146195Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:a13f775aa9b5050ab95f5e21fc0899d2ae2581f518f07b713bdb0521130e9fe1","observation_id":"0f31b0e4-b19d-4e96-ab1a-bdc972a34713","resolution":{"observed_at":"2026-08-15T15:11:01.927655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.912363Z","title":"In: Proceedings of the 31st ACM International Conference on Multimedia","venue":null,"work_id":"ab02e071-517e-48b1-a1e8-af60dafef3d1","year":2023},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.149632Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:8d3eac01b10aa10ee2126b2c867a4915b65e3aaa11d13edecfe09e1e4aa69d39","observation_id":"98721acc-3e84-4279-a3e5-e7dac459fb87","resolution":{"observed_at":"2026-08-15T15:11:01.915782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.899057Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"1cc25fd7-d86b-4bad-a236-0cce69a98c40","year":2023},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.152898Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:b3b79305700c40fa50f51a67c0814e273f891d743a77944c3cfa2d1ca5d7dd42","observation_id":"5389d848-7425-4ad9-aff5-6f5c90dafc8e","resolution":{"observed_at":"2026-08-15T15:11:01.902937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.887045Z","title":"In: The Thirty-ninth Annual Con- ference on Neural Information Processing Systems (2025)","venue":null,"work_id":"b44693d2-13cd-4d40-8b32-38e8e5a0b402","year":2025},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.157043Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:2bb01b28b3c6b8147b04e823a6fd692685977f22aa9875d03a6f67e370f795d4","observation_id":"5e8360c6-6bf5-4706-b312-84a22663c4fd","resolution":{"observed_at":"2026-08-15T15:11:01.890519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.875582Z","title":"ACM Transactions on Graphics (TOG)39(6), 1–16 (2020)","venue":null,"work_id":"51a65075-e412-4ade-86c1-fae5bb41c636","year":2020},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.160297Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:bc53b000861dbc7613a8d92063a7a567c865d3b986cbce975c29a000e89f35ca","observation_id":"03f11b8f-b8d4-4a86-aaff-5e93ce21749c","resolution":{"observed_at":"2026-08-15T15:11:01.879135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.864049Z","title":"IEEE Transactions on Visualization and Computer Graphics30(10), 6984–6996 (2024)","venue":null,"work_id":"95693c25-a6d6-4099-b3e5-d29635d3cd4c","year":2024},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.163593Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:e8960b6b24504e89d585251bd1e8ee50c1793e70257e63fc62581698a0b02fe5","observation_id":"613137fd-7eae-4822-bf54-d8b82631cfe2","resolution":{"observed_at":"2026-08-15T15:11:01.867580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.851995Z","title":"In: International Conference on Learning Representations (2024)","venue":null,"work_id":"19748963-d2cb-4920-96c2-a60076b9c416","year":2024},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.167063Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:062b53aa71c7dd4945c588f258109146b80bd021461c48b74b794b59de06d1fa","observation_id":"9ff9c636-8073-4c45-be5f-2d131682cf06","resolution":{"observed_at":"2026-08-15T15:11:01.855781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.840427Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"15abef6a-6d8f-4a41-b39e-ceb4508a97db","year":2023},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.170480Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:f8f49bb2a0ab29b231c7418d61dbec232ef14cd39b18ba62a15141a9edd1e00f","observation_id":"6984bfff-5586-4387-83b0-9f91b54cc2bb","resolution":{"observed_at":"2026-08-15T15:11:01.843970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.174775Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.174775Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:fce373207e3137539a7322f35012ae33447e20eaec6530365565a53d42e76c2e","observation_id":"b3e178f1-c747-4543-a115-7589959e92cd","resolution":{"observed_at":"2026-08-15T15:11:01.174775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06064","last_updated":"2026-07-24T02:23:21Z","snapshot_observed_at":"2026-08-13T14:04:21.029473Z","submitted_at":"2026-05-07T11:48:39Z","title":"PersonaGesture: Single-Reference Co-Speech Gesture Personalization for Unseen Speakers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.06064","snapshot_observed_at":"2026-08-15T15:11:01.178337Z","title":"arXiv preprint arXiv:2605.06064 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.178337Z"},"links":{"cited_paper":"/paper/2605.06064","citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:7a32e6f1c51f1cec9d5fa348c35653f4b6455f4aa0b93774a02d579537552cdd","observation_id":"7864c548-0868-49fc-873d-f2ad21b70d84","resolution":{"observed_at":"2026-08-15T15:11:01.178337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.820376Z","title":"IEEE Transactions on Circuits and Systems for Video Technology35(10), 10410–10422 (2025)","venue":null,"work_id":"22d4a0ea-cf32-4ffe-9209-3d0c150bf340","year":2025},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.181784Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:86f7af98f2606f6083121ecb30d8c8d6ede3c8fbbad64b24e9792858f8920d98","observation_id":"32fafcca-5756-4624-be44-b7cd6e670fec","resolution":{"observed_at":"2026-08-15T15:11:01.824108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.10076","last_updated":"2026-08-16T15:51:15Z","snapshot_observed_at":"2026-08-19T08:14:38.606471Z","submitted_at":"2025-11-13T08:30:35Z","title":"Mitigating Error Accumulation in Co-Speech Motion Generation via Global Rotation Diffusion and Multi-Level Constraints","version":3},"cited_work":{"arxiv_id":"2511.10076","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":"2511.10076","snapshot_observed_at":"2026-08-18T02:13:22.046252Z","title":"arXiv preprint arXiv:2511.10076 (2025)","venue":null,"work_id":"8edd7ae2-c4a8-4ffb-b5e0-778f4904c1b6","year":2025},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.185336Z"},"links":{"cited_paper":"/paper/2511.10076","citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:c8e75a87849ce99ccfc8b47466dd8cc68989a64d7d40be7cf9f81d4f772aeb8b","observation_id":"97f63093-2617-4723-a5fb-9dd0fde1f6ac","resolution":{"observed_at":"2026-08-18T02:13:22.046252Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.809027Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":"0b620184-4b31-411d-9752-c4cd1b77ba68","year":2025},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.188681Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:5b728fc8dbf5cc3b79364a57e0b45e0d0eb823c4d377a7b2f557a8927e3dcf25","observation_id":"faab9dcc-49c1-446b-84f1-e9e52814b3b7","resolution":{"observed_at":"2026-08-15T15:11:01.812569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.796453Z","title":"In: Pro- ceedings of the 33rd ACM International Conference on Multimedia","venue":null,"work_id":"a6fb96e5-3264-4aef-91c5-8c1c979fc74f","year":2025},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.192071Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:5957ed4b212e90d1bba8ea9efc9a7902bb66ddf453db0a560de6fd48e791ccda","observation_id":"7b5db14c-87dc-47d8-9109-5c45f142ab9a","resolution":{"observed_at":"2026-08-15T15:11:01.800732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.783663Z","title":"ACMTransactionson Graphics (TOG)43(4), 1–17 (2024)","venue":null,"work_id":"f848e612-4132-4e35-a44b-6959fc9cd8e7","year":2024},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.195466Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:bab067331502a7e5a616c770ad2387cfe4e7d02000c636bfbb5a9c8b951655f6","observation_id":"614f1b16-b18b-4eae-b22b-8eb088e00d3d","resolution":{"observed_at":"2026-08-15T15:11:01.787511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10061","last_updated":"2024-07-14T03:12:19Z","snapshot_observed_at":"2026-08-16T13:34:26.769167Z","submitted_at":"2024-07-14T03:12:19Z","title":"InfiniMotion: Mamba Boosts Memory in Transformer for Arbitrary Long Motion Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10061","snapshot_observed_at":"2026-08-15T15:11:01.198949Z","title":"arXiv preprint arXiv:2407.10061 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.198949Z"},"links":{"cited_paper":"/paper/2407.10061","citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:4f8acebcf9071867fb8fd330b79202888fcbe5938c9ae306977dde03d0befe87","observation_id":"8b1ebfb6-6081-4539-bd80-a47a778c716e","resolution":{"observed_at":"2026-08-15T15:11:01.198949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.771626Z","title":"IEEE Transactions on Mul- timedia (2025)","venue":null,"work_id":"26e66490-8b3d-4fba-b4e1-4d5a6d0220ef","year":2025},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.203073Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:1ed28279d3a8d6c376f157efa102eb308841336001fa1fd86a958af4b98907b8","observation_id":"75274397-9962-4450-8ccb-75bafbe527cf","resolution":{"observed_at":"2026-08-15T15:11:01.775131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27055","last_updated":"2026-05-26T14:10:12Z","snapshot_observed_at":"2026-08-13T14:05:06.778990Z","submitted_at":"2026-05-26T14:10:12Z","title":"Semantic-Aware Motion Encoding for Topology-Agnostic Character Animation","version":1},"cited_work":{"arxiv_id":"2605.27055","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.27055","snapshot_observed_at":"2026-08-15T15:11:01.256888Z","title":"Semantic-Aware Motion Encoding for Topology-Agnostic Character Animation","venue":"cs.GR","work_id":"d3db774b-268a-4313-be4b-32228ab6578c","year":2026},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.206474Z"},"links":{"cited_paper":"/paper/2605.27055","citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:4c2f9fbc67be44ccc57cbfdbcaff97540a01eab77def458a6320688488204a9d","observation_id":"c50f34e1-da7b-46f3-af3f-5f2a270f0dce","resolution":{"observed_at":"2026-08-15T15:11:01.262723Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.759939Z","title":"In: Proceedings of the 33rd ACM International Conference on Multimedia","venue":null,"work_id":"59d188ed-e0e3-40d1-bed0-c43e05f1b47a","year":2025},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.210254Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:d96bf0a870849d64aeda71e1cdb1d67ee738983532d43e468913b9c8a95789e5","observation_id":"79d3935a-393b-4cbc-9043-3e289b181890","resolution":{"observed_at":"2026-08-15T15:11:01.763549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.748173Z","title":"In: ICASSP 2025 - 2025 IEEE International Conference on Acoustics, Speech and Signal Processing","venue":null,"work_id":"7382a260-b378-4264-b57d-b214fb00cbbf","year":2025},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.213749Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:32ac11e33d6aa836e779bad5b987e88dedb56f2d9c60a6dd9a04fd5e1302c4d1","observation_id":"1e9a7b9f-5af3-4bc2-b41d-9177cbe0806f","resolution":{"observed_at":"2026-08-15T15:11:01.751880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.736195Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":"d5236780-0ed5-404a-ad2d-b964a4e2823c","year":2023},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.217048Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:09be3e96b8aa0e0144a9a8d2fb436a6d84b0f3b0a82f4001cc4f723814c115ae","observation_id":"2a6bec05-427c-4490-a0a2-7a686abc4a73","resolution":{"observed_at":"2026-08-15T15:11:01.739869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.220574Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.220574Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:1897ee2de87b6b5eef34fcba6b5b7c1dfdc2f8dca230d91d49d56eccf2a4f8fb","observation_id":"8e539918-30f1-4bcf-bb4d-51f76fa54889","resolution":{"observed_at":"2026-08-15T15:11:01.220574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.223944Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.223944Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:97753dc9ca759b9fdf2a536a388554ebc366c07aed190ee2dedad13471137bee","observation_id":"1a02ff99-ec1c-48bd-b6f4-f8fadc624d26","resolution":{"observed_at":"2026-08-15T15:11:01.223944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T01:34:31.295297Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":21,"verified_exact":2,"verified_fuzzy":45},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 0 inbound Pith citation observations for arXiv:2608.01643."}