{"as_of":"2026-08-07T11:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:69d9d301db5a2ea8fa8afb806a9285b29adfc38bed5d85e10c7d0c76359464be","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:50:07.536013Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.04522/citation-record","integrity":"/paper/2507.04522/integrity","json":"/paper/2507.04522/citation-record.json","paper":"/paper/2507.04522"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:13.050981Z","title":"GestureDiffu- CLIP: Gesture diffusion model with CLIP latents","venue":null,"work_id":"f41a10f1-3b79-43ed-9920-8aebbc93f2f4","year":2023},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:03.629393Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:23d552a6e4cf023df1f9ee1ec9342a30f079f18647d22ec0bf60d4bef35e075a","observation_id":"d2a030c4-9c80-4783-b580-cc49fbdb0d99","resolution":{"observed_at":"2026-08-06T19:50:13.116793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:12.902662Z","title":"Multimodal referencing: Grounding generative models in situated communication, 2025","venue":null,"work_id":"75c5b59a-1e57-47fa-90a5-f867658bf786","year":2025},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:03.700641Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:0992c9abdbc4fc2f2d3100e1b849ecfe27c06d63651aebda46fae1fc39fcdfc7","observation_id":"83ad97ee-e411-40b0-bdfa-11092419905d","resolution":{"observed_at":"2026-08-06T19:50:12.975013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:12.745398Z","title":"WhisperX: Time-accurate speech transcription of long- form audio","venue":null,"work_id":"0db15b82-dd1c-4bae-92e1-8ac1c516a4f7","year":2023},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:03.845844Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:905b5f9cd1ba6913b059210d09c876d34843175cf7246bc7a357903c3fec155c","observation_id":"6e7242c9-bf95-4793-9907-2b0e489deefd","resolution":{"observed_at":"2026-08-06T19:50:12.811067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-06T19:50:03.932721Z","title":"F5-TTS: A fairytaler that fakes fluent and faithful speech with flow matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:03.932721Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:dcbb36568fd65bc8fdc2bf5473252c29dc575f3171c338d67c451118ea874328","observation_id":"cff693cc-2ac9-4126-a8c8-6e762e54d742","resolution":{"observed_at":"2026-08-06T19:50:03.932721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:12.588383Z","title":"In- corporating spatial awareness in data-driven gesture gener- ation for virtual agents","venue":null,"work_id":"29baa421-3357-4085-af5e-5c33e7b81f34","year":2024},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:04.065628Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:2d501639125f873ed94c1e05a3f63bd00b631636569ed750e9e93520e5d0206c","observation_id":"840c538e-51c7-479f-822f-6e0e6875f92c","resolution":{"observed_at":"2026-08-06T19:50:12.657167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:12.427891Z","title":"Diffusion-based co-speech gesture genera- tion using joint text and audio representation","venue":null,"work_id":"c6d9c6ea-90c1-4593-86b3-733a8f32d5e8","year":2023},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:04.198433Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:296cb41715740b1c43e025c429bc0ee7b873556d6994e420d235cc993c6ad3aa","observation_id":"ee322aaa-c823-4675-8917-9786148c6eb8","resolution":{"observed_at":"2026-08-06T19:50:12.497542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00253","last_updated":"2024-09-30T21:51:30Z","snapshot_observed_at":"2026-08-01T05:46:19.804175Z","submitted_at":"2024-09-30T21:51:30Z","title":"MM-Conv: A Multi-modal Conversational Dataset for Virtual Humans","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00253","snapshot_observed_at":"2026-08-06T19:50:04.281234Z","title":"MM-Conv: A multi-modal conversational dataset for virtual humans","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:04.281234Z"},"links":{"cited_paper":"/paper/2410.00253","citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:41b98041347f4e44e5282564c7b3066d0ce30d9b9537f0c8b70b1f5f3d4af890","observation_id":"10bdca01-ee96-4a22-b5cc-425c85461871","resolution":{"observed_at":"2026-08-06T19:50:04.281234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:12.269980Z","title":"Towards context-aware human-like point- ing gestures with rl motion imitation","venue":null,"work_id":"955beb6f-3048-44fb-b15d-63612435e968","year":2022},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:04.386457Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:ad2a426121a26b2e2e9a0c32bea43e94726c9082a4c32e5336268efc48efecd1","observation_id":"f0b9be30-c17c-48f5-b086-398732d3a8d6","resolution":{"observed_at":"2026-08-06T19:50:12.359123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:12.064901Z","title":"Investigating the use of recurrent motion modelling for speech gesture generation","venue":null,"work_id":"3c5ca73c-b381-4e6e-a10f-1033336bd6da","year":2018},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:04.504162Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:e988742d6316c0d465b2bbb8983ebc9021971ed29f955f442c03039bbaab11b2","observation_id":"ec4ce390-a50e-48d6-872e-35586b8ffa74","resolution":{"observed_at":"2026-08-06T19:50:12.162163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:11.879869Z","title":"IV A: Investigating the use of recurrent motion modelling for speech gesture gen- eration","venue":null,"work_id":"51049779-452a-443e-b701-e7816eccbf50","year":2018},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:04.610387Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:940e2f0978d31767194852d66e76fd90ce1357e71448d2c2c4f1dbb797d88f1a","observation_id":"33ab9391-36f2-43e3-957e-ec1aa65725a1","resolution":{"observed_at":"2026-08-06T19:50:11.972027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.04160","last_updated":"2019-06-10T17:58:08Z","snapshot_observed_at":"2026-07-06T07:59:19.943467Z","submitted_at":"2019-06-10T17:58:08Z","title":"Learning Individual Styles of Conversational Gesture","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.04160","snapshot_observed_at":"2026-08-06T19:50:04.689024Z","title":"Learning individual styles of conversational gesture","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:04.689024Z"},"links":{"cited_paper":"/paper/1906.04160","citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:4f57725b74efa04ebfec33c6fdd37483a881e6b1b6356fe92ff6cc7b86e72275","observation_id":"d19b05bf-d352-4902-b5d9-2976d374ec6e","resolution":{"observed_at":"2026-08-06T19:50:04.689024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:11.697712Z","title":"Generating diverse and natural 3d human motions from text","venue":null,"work_id":"46d4b2c6-3d41-4e61-9d96-50d85ba69523","year":2022},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:04.794391Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:540c7957227cee8c506213ce41ef843c431be231f669f7333cbebad940d49df5","observation_id":"9293ce30-5718-4b83-83f9-956ae68686d7","resolution":{"observed_at":"2026-08-06T19:50:11.771853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:11.499325Z","title":"Generating diverse and nat- ural 3D human motions from text","venue":null,"work_id":"be916aaf-5521-4b5f-9322-00021de6dc13","year":2022},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:04.911642Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:2ea96c630174ab43784611ac0a79b69b2ba26127183c0b36559b6ef0e24f47ac","observation_id":"22c2cc34-8435-4fde-86a7-681dc2990d82","resolution":{"observed_at":"2026-08-06T19:50:11.595191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:11.275015Z","title":"Automatic deictic ges- tures for animated pedagogical agents","venue":null,"work_id":"ffd52f19-b469-47e3-b330-6a043f1320d7","year":2019},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:05.018409Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:3a54d0dbcb65ca9d075f7e5b41f1186a0a78c4f26933dc50c676662f573fe360","observation_id":"7f351244-4a7d-4a5a-9bd3-86281ff32fd7","resolution":{"observed_at":"2026-08-06T19:50:11.398664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.05474","last_updated":"2022-08-26T17:12:17Z","snapshot_observed_at":"2026-07-06T06:14:28.435222Z","submitted_at":"2017-12-14T23:17:24Z","title":"AI2-THOR: An Interactive 3D Environment for Visual AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.05474","snapshot_observed_at":"2026-08-06T19:50:05.106839Z","title":"AI2-THOR: An interactive 3D environment for visual AI","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:05.106839Z"},"links":{"cited_paper":"/paper/1712.05474","citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:f4f36e7e5b7de01c947822bbcfcac0e334c4df53b7acb04059b8a0bd37bd842e","observation_id":"20f1bb53-2066-4dfb-99de-171ef71815aa","resolution":{"observed_at":"2026-08-06T19:50:05.106839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:11.095563Z","title":"Talking With Hands 16.2M: A large-scale dataset of synchronized body- finger motion and audio for conversational motion analy- sis and synthesis","venue":null,"work_id":"c32bb9f9-f51f-4110-bf68-16bc31bce2ba","year":null},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:05.235429Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:c175718ea35a5165d5032b4b9186c660e3dc5c9904167db45ec396a37a5cc0b6","observation_id":"06f30f57-3b5a-417a-ada5-782949d22d18","resolution":{"observed_at":"2026-08-06T19:50:11.171691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:10.903501Z","title":"Deictic believability: Coordinated ges- ture, locomotion, and speech in lifelike pedagogical agents","venue":null,"work_id":"0618482a-5526-4be0-8647-29868e0ea242","year":1999},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:05.347824Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:e7ab32fbec0e79cf114768a091d3ea2e1d0680a791ad46b54c5fdd74d1582d33","observation_id":"d1e34bab-8f38-4591-a70c-9d6f887e2ca2","resolution":{"observed_at":"2026-08-06T19:50:10.973363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:10.720537Z","title":"Controllable human-object interaction synthesis","venue":null,"work_id":"15a03611-1306-4911-86f1-267e582b43a2","year":2024},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:05.439378Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:3540219058f0b86abeda5626bc21c33acd549337494144cc5a5ebd56fae21d0c","observation_id":"e2104276-cda5-4d93-a977-8de37b99001e","resolution":{"observed_at":"2026-08-06T19:50:10.806290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:10.534700Z","title":"Black, Hao Li, and Javier Romero","venue":null,"work_id":"b05c4d54-a4da-4eab-8bc1-7578002ceaed","year":null},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:05.617780Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:622476f1355501a3b36f4dd3d5ae78d267acdbe1cb97cf8a102bd3fc39f19add","observation_id":"52b3c9e0-b376-4845-b560-c96f7b5d64cf","resolution":{"observed_at":"2026-08-06T19:50:10.608842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06071","last_updated":"2024-03-05T14:36:12Z","snapshot_observed_at":"2026-07-30T19:32:30.807724Z","submitted_at":"2024-01-11T17:41:57Z","title":"GroundingGPT:Language Enhanced Multi-modal Grounding Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06071","snapshot_observed_at":"2026-08-06T19:50:05.707838Z","title":"GroundingGPT: Language enhanced multi-modal grounding model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:05.707838Z"},"links":{"cited_paper":"/paper/2401.06071","citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:9d3265df8fe01de74dfef7933358d20b54b969bc5097e0b02e904025fb8a390e","observation_id":"7b59254b-d862-46ce-b065-c05fb0b57cd9","resolution":{"observed_at":"2026-08-06T19:50:05.707838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:10.311501Z","title":"EMAGE: Towards unified holistic co-speech gesture generation via expressive masked audio gesture modeling","venue":null,"work_id":"b3eff0a7-3607-4b7f-a81a-02865c606fb1","year":2024},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:05.801928Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:ba6d961cb19e5ec593337cb66fc1b8c6e223b194037697cdf53d43f56d3749bd","observation_id":"1dd568d2-40eb-4b22-ae58-99d1b23ee38e","resolution":{"observed_at":"2026-08-06T19:50:10.419729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.05297","last_updated":"2022-09-20T05:44:29Z","snapshot_observed_at":"2026-07-06T12:46:23.306134Z","submitted_at":"2022-03-10T11:19:52Z","title":"BEAT: A Large-Scale Semantic and Emotional Multi-Modal Dataset for Conversational Gestures Synthesis","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.05297","snapshot_observed_at":"2026-08-06T19:50:05.916278Z","title":"BEAT: A large-scale semantic and emotional multi-modal dataset for conversational gestures synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:05.916278Z"},"links":{"cited_paper":"/paper/2203.05297","citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:1b34dfaddac53f2953275655a255cf545caf3717c8a4927f5bcc8113f964e048","observation_id":"60bc39e7-37f9-4f27-a445-72bf93eb9776","resolution":{"observed_at":"2026-08-06T19:50:05.916278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:10.131126Z","title":null,"venue":null,"work_id":"3b19e56c-83d9-4ff5-9c86-b3efdbe94017","year":2014},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:06.012590Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:f82a1b741b632fb63205a1b9f49be06a05fbc7e1a8d0df95b9e4df952860308b","observation_id":"c15ceb32-d0ff-4701-b969-b5ab0aef3416","resolution":{"observed_at":"2026-08-06T19:50:10.232891Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:09.905619Z","title":"AMASS: Archive of motion capture as surface shapes","venue":null,"work_id":"9ff9c3f8-e25f-4eae-8a76-b4d3d8a9dfcb","year":2019},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:06.124983Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:a7fac25dc9f1ddbca5becf992427463a03646974a7a3f8e8f54c8f62bf19b37e","observation_id":"6637cae7-ea7e-4477-8c7c-2bf464c655c8","resolution":{"observed_at":"2026-08-06T19:50:10.015638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:09.709296Z","title":"Design of a virtual human presenter","venue":null,"work_id":"c1caf74d-2a46-47ee-b9a8-9a067eb86e1f","year":2002},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:06.269557Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:2b1e4c6100d200d8fe998555914e16a391f5f385011b7d27308d3b8917757d02","observation_id":"ae674419-b227-48ba-9d25-f1bb8522bf0c","resolution":{"observed_at":"2026-08-06T19:50:09.784238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:09.516227Z","title":null,"venue":null,"work_id":"6b6223cc-55ad-4932-b5e3-f8c8f91301ea","year":2019},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:06.421212Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:b864adca02bf4e14d0064e0d408fc20c8f8b0b8a6c5be111a766574de96675d9","observation_id":"dfab8d58-1c15-46aa-a256-0feea1395e08","resolution":{"observed_at":"2026-08-06T19:50:09.609324Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:09.329558Z","title":"The KIT Motion-Language Dataset","venue":null,"work_id":"feba576b-248f-4a32-9e7f-59b3a43823a2","year":2016},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:06.571398Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:1912457b56e4cb8ff074381bf71a91f324b93d048cd67449e3ad365d2941309d","observation_id":"f2982cd3-1b48-47e7-9e4a-9d1534100f57","resolution":{"observed_at":"2026-08-06T19:50:09.405944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:09.086746Z","title":"Animated agents for pro- cedural training in virtual reality: Perception, cognition, and motor control","venue":null,"work_id":"451dfae7-d077-4234-94a8-0bbe21737cd2","year":1999},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:06.669960Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:16e230fb896b76034aa9678b4dfb4979d15abf29aa68a107328528c74471035f","observation_id":"34b447a7-8749-4af6-b736-17bd87b07460","resolution":{"observed_at":"2026-08-06T19:50:09.213966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:08.888381Z","title":"Move as you say interact as you can: Language-guided human motion generation with scene af- fordance","venue":null,"work_id":"fe9755f6-0920-4afb-aa38-6a7f47884eae","year":null},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:06.793081Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:f874741b6525a370923c6fb6b12890a0378b70b5a6ff0859e6cef3c0d3874e61","observation_id":"63733492-aeba-4176-8a7a-c238a922cfff","resolution":{"observed_at":"2026-08-06T19:50:08.998585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:08.681390Z","title":"HUMANISE: Language-conditioned hu- man motion generation in 3D scenes","venue":null,"work_id":"0577c09c-84ae-4b60-8832-564c531aa79b","year":2022},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:06.912657Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:c2055dc0d65a364aa9b248ca414b34f6b8ba0c553de4915857452fe9179a8b7a","observation_id":"3a42d82f-8301-4075-adf1-f950b1045f5d","resolution":{"observed_at":"2026-08-06T19:50:08.776305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:08.456341Z","title":"OmniControl: Control any joint at any time for human motion generation","venue":null,"work_id":"fa436540-a070-4036-8294-c52b56659a61","year":2024},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:07.072912Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:3d7cc2530f42e928d00213bfc43ed012b6a894cf74c7c4f9a79359f26c3ed28f","observation_id":"72b78304-dbe4-4b85-9c29-64b09326097e","resolution":{"observed_at":"2026-08-06T19:50:08.531050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:08.258531Z","title":"Inter-X: Towards versatile human- human interaction analysis","venue":null,"work_id":"7958a24d-ad31-4ca0-b211-cf935e64cc41","year":null},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:07.177655Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:aeb6a6860a5186670bc4d852e0bbb746305d5cbeb584c24cb872c4dc63600ab7","observation_id":"8ca639e9-c769-438b-8fad-b9098dbc0f5a","resolution":{"observed_at":"2026-08-06T19:50:08.350360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:07.993815Z","title":null,"venue":null,"work_id":"0d7321cb-22e8-4c4b-a240-0ba6e8a85262","year":2023},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:07.291690Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:e66201eb94f57bb6283a1293f870b0c2a0de23d32ae64c4575819a8fa8391ecc","observation_id":"3f8764f2-1593-4004-9a07-87364a934c35","resolution":{"observed_at":"2026-08-06T19:50:08.136137Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:07.409636Z","title":"Generating human interaction motions in scenes with text control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:07.409636Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:22d88ec7a4c896333b1075fb131463fb3736e8e750c5c4ff7e588cceaeddfe84","observation_id":"b1929e41-a0ea-4c4a-a949-8708ca0b3a36","resolution":{"observed_at":"2026-08-06T19:50:07.409636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:07.728923Z","title":"See that bench over THERE, we could sit there","venue":null,"work_id":"1fdacda5-8cec-4eb8-b92e-2a3f2e739a13","year":null},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:07.536013Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:9002d6555494b626e0ffb7a6c0668dc86dbb7cfd0d6a0e36e09f5cbc577a6581","observation_id":"9f0229df-734f-461e-99d5-fb2e21e0f174","resolution":{"observed_at":"2026-08-06T19:50:07.843457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2507.04522."}