{"as_of":"2026-08-13T07:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b917a43cf6c40038a601fe9bee5a6a49fb9fec247336beae9a642074c2cbb5a7","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:17:00.665972Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.16729/citation-record","integrity":"/paper/2411.16729/integrity","json":"/paper/2411.16729/citation-record.json","paper":"/paper/2411.16729"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.04919","last_updated":"2023-05-08T17:54:58Z","snapshot_observed_at":"2026-08-12T07:17:10.381113Z","submitted_at":"2023-05-08T17:54:58Z","title":"DiffuseStyleGesture: Stylized Audio-Driven Co-Speech Gesture Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04919","snapshot_observed_at":"2026-08-12T14:17:00.502788Z","title":"DiffuseStyleGesture: Stylized audio-driven co-speech gesture generation with diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.502788Z"},"links":{"cited_paper":"/paper/2305.04919","citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:9cc0ee8b8895dde61b7c20bd99c3d0f2024dff9bd9dc3b1f05a6ac2ad2689604","observation_id":"055fc402-0c08-4801-9e8f-c169a891ffcb","resolution":{"observed_at":"2026-08-12T14:17:00.502788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.363230Z","title":"The diffusestylegesture+ entry to the genea challenge 2023,","venue":null,"work_id":"e4852125-4970-4210-bcf3-de60f71922e3","year":2023},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.508549Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:290f5bf12fa6253b93747e3e491642975226cddc1c3c316b28d6c644717cb712","observation_id":"899b5813-b992-493e-a53f-b66135a500d2","resolution":{"observed_at":"2026-08-12T14:17:01.368431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.348818Z","title":"Gesturediffuclip: Gesture diffusion model with clip latents,","venue":null,"work_id":"fd98014f-429b-4153-b194-2892cbae3d0d","year":2023},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.513047Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:49e5709a40510d7082ab939da89d68dbc30ed4026e75b7608d34a99965f12cb6","observation_id":"d9f01c89-db94-4c80-b469-09136ec7c473","resolution":{"observed_at":"2026-08-12T14:17:01.353269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:00.517549Z","title":"Listen, denoise, action! audio-driven motion synthesis with diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.517549Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:23cf28bc73356f901550841dfc57844965a1c337b8d541c465aaf8ad7a707a35","observation_id":"8edc59ca-2422-476b-93b1-fb8e56b5b844","resolution":{"observed_at":"2026-08-12T14:17:00.517549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/1050809","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:00.874770Z","title":"Speech-driven personalized gesture synthetics: Harnessing automatic fuzzy feature inference,","venue":null,"work_id":"72ca903d-a56f-4cdb-8764-01778cf52f77","year":2024},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.522115Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:1a5844307165ff6e83155bc165826e6e522f1680555db9d03b59b204f26698bd","observation_id":"3e4fef0c-740e-4ac7-90ba-7b9e5a97fa42","resolution":{"observed_at":"2026-08-12T14:17:00.882199Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:00.526438Z","title":"Scalable diffusion models with transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.526438Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:46f4e24529a231fa1d404abb7f4146cd19212062754cda85b7a142f579f6b584","observation_id":"ddaad137-a51e-4f59-96e4-16bce4a02927","resolution":{"observed_at":"2026-08-12T14:17:00.526438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-12T14:17:00.531386Z","title":"Mamba: Linear-time sequence modeling with selective state spaces,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.531386Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:87f8979714f23c296d589a17d319ca99e05cb1d3e62175becc13e541baf5d24a","observation_id":"4c60bf59-57fd-48b6-9670-9075a63bea42","resolution":{"observed_at":"2026-08-12T14:17:00.531386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09417","last_updated":"2024-11-14T02:00:33Z","snapshot_observed_at":"2026-07-06T17:16:59.193820Z","submitted_at":"2024-01-17T18:56:18Z","title":"Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09417","snapshot_observed_at":"2026-08-12T14:17:00.535931Z","title":"Vision mamba: Efficient visual representation learning with bidirectional state space model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.535931Z"},"links":{"cited_paper":"/paper/2401.09417","citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:08246443d44fea3041c76ec9c91ec2a4bba7752948f82ef1e446f2a2c06d9529","observation_id":"ccb8e988-c569-4246-8066-a2c03a4b47b6","resolution":{"observed_at":"2026-08-12T14:17:00.535931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04722","last_updated":"2024-01-09T18:53:20Z","snapshot_observed_at":"2026-07-06T17:13:25.341853Z","submitted_at":"2024-01-09T18:53:20Z","title":"U-Mamba: Enhancing Long-range Dependency for Biomedical Image Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04722","snapshot_observed_at":"2026-08-12T14:17:00.540557Z","title":"U-mamba: Enhancing long-range dependency for biomedical image segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.540557Z"},"links":{"cited_paper":"/paper/2401.04722","citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:83a90455a1cedaf888909e4692ffcf5ff2573195b41c3863cc1511674923c2df","observation_id":"509de8a1-2db2-471e-ba33-d7e085b59c0c","resolution":{"observed_at":"2026-08-12T14:17:00.540557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.316539Z","title":"Videomamba: State space model for efficient video understanding,","venue":null,"work_id":"f08cf539-ecc0-4368-b346-82736a0be618","year":2025},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.544987Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:602a964ffd328c107a0288ae6a9be4f0c7a259c3793b3d6f44c391f01d6c028f","observation_id":"fc2d7944-3d7a-4d5f-b06d-2a675a702218","resolution":{"observed_at":"2026-08-12T14:17:01.321133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.302294Z","title":"Segmamba: Long-range sequential modeling mamba for 3d medical image segmentation,","venue":null,"work_id":"aace726c-2a95-4c66-b62d-be008aee423b","year":2024},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.549265Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:cdcd4f524331234078f3a356159aa9ed63b8a6d5741fe282c7820da06d22a928","observation_id":"237e082c-ac8b-4891-9a51-7e39a6219726","resolution":{"observed_at":"2026-08-12T14:17:01.306904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.287580Z","title":"Graph mamba: Towards learning on graphs with state space models,","venue":null,"work_id":"117ee543-3f3a-49fc-95e2-ed2a6de03512","year":2024},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.553243Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:23b745872e356c34e64a064f4aca2cd051684326d11c4694bb02e08c37b1e154","observation_id":"d18ad0ac-4edc-415b-8371-77c3bd431f1f","resolution":{"observed_at":"2026-08-12T14:17:01.292382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00789","last_updated":"2024-02-01T17:21:53Z","snapshot_observed_at":"2026-08-13T04:29:03.289216Z","submitted_at":"2024-02-01T17:21:53Z","title":"Graph-Mamba: Towards Long-Range Graph Sequence Modeling with Selective State Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00789","snapshot_observed_at":"2026-08-12T14:17:00.557485Z","title":"Graph-mamba: Towards long-range graph sequence modeling with selective state spaces,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.557485Z"},"links":{"cited_paper":"/paper/2402.00789","citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:68deafcff8c5ca50e4335d24f999e44093ebc713307e5a9bbf494182e3abdc8e","observation_id":"73e8b239-0e27-41c6-b7b9-7767deb561b5","resolution":{"observed_at":"2026-08-12T14:17:00.557485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-08-12T14:17:00.561955Z","title":"Transformers are SSMs: Generalized models and efficient algorithms through structured state space duality,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.561955Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:48b865da2500da4017bd49a2892d4374c254b3c7cc3432e831b7856bc91a4eb7","observation_id":"20c88340-18d5-47b5-abbc-f899329b04b8","resolution":{"observed_at":"2026-08-12T14:17:00.561955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.273199Z","title":"Investigating the use of recurrent motion modelling for speech gesture generation,","venue":null,"work_id":"77980691-2e7b-4299-a208-e2569e17a9cb","year":2018},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.566536Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:d4e8c483ddba0829a874fb4eef73bf71d6081a3c21d37a5b1cf005896b96d42e","observation_id":"6f199829-ed50-4319-9e43-4a594e7f62e5","resolution":{"observed_at":"2026-08-12T14:17:01.278117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.258872Z","title":"Zeroeggs: Zero-shot example-based gesture generation from speech,","venue":null,"work_id":"9b5930ac-52f7-482f-8797-28379e2ab7b4","year":2023},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.570531Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:ce20e90c48148593bf769570dfdc51dc0bb6e04faeb39640f7637e2ec50d6176","observation_id":"aa14dd1b-3686-41aa-868c-23bb9199c0d0","resolution":{"observed_at":"2026-08-12T14:17:01.263605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.244653Z","title":"Beat: A large-scale semantic and emotional multi-modal dataset for conversational gestures synthesis,","venue":null,"work_id":"7602d6ac-a3e9-42b6-acbc-036f511bffc2","year":2022},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.574722Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:85f8395fe904ad43174bd7d015416614c7c6365acce61b8e12249f91ab5297f2","observation_id":"239ce9cc-779d-46f6-9d2e-a0ba30e97cde","resolution":{"observed_at":"2026-08-12T14:17:01.249152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.229957Z","title":"Talking with hands 16.2 m: A large-scale dataset of synchronized body-finger motion and audio for conversational motion analysis and synthesis,","venue":null,"work_id":"e7c3d35a-b91e-4f0b-ae4d-17e914c5fcc6","year":2019},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.578973Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:705d7d1256780b2abb4dda5a2b8a4b7d397ab403578c7e3cb2bb557f70c18f8d","observation_id":"1adc3dcd-6a20-42ab-96d5-19770a5ad80c","resolution":{"observed_at":"2026-08-12T14:17:01.234963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.214143Z","title":"Diffmotion: Speech-driven gesture synthesis using denoising diffusion model,","venue":null,"work_id":"6ca6f634-98ab-43d1-8842-6d30024e1e89","year":2023},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.583168Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:1202e7d84386e1cca7432654a60cbc34082c96a5bafe184a4d70e89c4854dbe3","observation_id":"5afe33d7-6a9b-4fad-b648-1ca4623587eb","resolution":{"observed_at":"2026-08-12T14:17:01.219702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.198007Z","title":"Cross-modal quantization for co-speech gesture generation,","venue":null,"work_id":"663174f2-df1c-4602-bd67-bc88dbe169ad","year":2024},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.588308Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:aee6296dcc32c67b3fe551d770be22c45fa581b228665eb3dcb3b7a6b1227fcd","observation_id":"14f13b5b-fe0e-4e06-9d12-7bf2d102020f","resolution":{"observed_at":"2026-08-12T14:17:01.203564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.181879Z","title":"Adversarial gesture generation with realistic gesture phasing,","venue":null,"work_id":"c2ea867a-48ca-4f91-b89f-867b2e17cb0c","year":2020},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.592915Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:6507a83f726ae22c1dbcbbb85fb76bb303960aa423fdbb9337c8b654dc3261a0","observation_id":"7e1c343b-d32b-4e9e-9c8d-58cc03b9a682","resolution":{"observed_at":"2026-08-12T14:17:01.187081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.164597Z","title":"Robots learn social skills: End-to-end learning of co- speech gesture generation for humanoid robots,","venue":null,"work_id":"85b6a883-876f-4c39-9a45-e941a04bd5b0","year":2019},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.597094Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:dea65cacc41c82c2a3430dd34bf8d35d7eaa61f5a33c5f519021169bea3951d8","observation_id":"2c1254bc-6d92-432b-8969-079d804f6349","resolution":{"observed_at":"2026-08-12T14:17:01.170157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.147744Z","title":"chinese speech pretrain,","venue":null,"work_id":"025059e2-9c3f-4ebb-96d5-9343b06dfa49","year":2022},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.601661Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:0c8979d06a30570ab56ec165a8dddba5f19a0e77de1192affa824025946205e3","observation_id":"e289d0e2-23dc-4e3c-9802-cdf92a036c80","resolution":{"observed_at":"2026-08-12T14:17:01.152738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.125355Z","title":"Hand and mind: What gestures reveal about thought,","venue":null,"work_id":"3fc8c4d6-8ec2-4b47-99ec-520f61ed7ba9","year":1992},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.605924Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:0ae54fe1bc76cbdde820bdb4f6f11c06fe1c211c41f1caa0afe8f818f9afe4bf","observation_id":"7af6204c-aebb-4549-9638-d7379fe0ffce","resolution":{"observed_at":"2026-08-12T14:17:01.134088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:00.610099Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.610099Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:f747a2b2dfdc4d74a3eb1dfa306095848ee143a11f8f670f950ec97037f9cef9","observation_id":"32c75d3c-be01-4b00-940c-0577ec557a3a","resolution":{"observed_at":"2026-08-12T14:17:00.610099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.096630Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics,","venue":null,"work_id":"497be703-b9bc-4fdd-88af-af27229e3edb","year":2015},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.614428Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:0f489f2ed4b667f263337b89bb1dbfdce5a3495e80d671d95b49fa737cbc72f9","observation_id":"dbb3583f-e517-4747-9818-9cc316e04ba2","resolution":{"observed_at":"2026-08-12T14:17:01.101912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.078023Z","title":"sur la th ´eorie du mouvement brownien,","venue":null,"work_id":"d45ba3ca-f211-4079-b1c7-c9f688128cf5","year":1908},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.618678Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:b49d8e6adca5e1145e530404e435532017bdd2087481e7705fbb91ccf0535a54","observation_id":"2e8a39c7-1684-4bd5-b9f3-4b52bd7f9ebe","resolution":{"observed_at":"2026-08-12T14:17:01.084440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.061689Z","title":"Autoregressive denoising diffusion models for multivariate probabilistic time series forecasting,","venue":null,"work_id":"663bbe97-8d8a-444f-91ea-1f1132b83c6a","year":2021},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.622873Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:c47155a5b1dd7b326bde3231181647a148259e8baf389d0a5d89335e0dbba0ff","observation_id":"9992ab7b-a54d-4c6c-b176-d8f4ac5b5abe","resolution":{"observed_at":"2026-08-12T14:17:01.067413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.044657Z","title":"Style-Controllable Speech-Driven Gesture Synthesis Using Normal- ising Flows,","venue":null,"work_id":"9777a577-311c-403c-b7fc-e3656a9ea292","year":2020},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.627269Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:b29c61590d97082b20b914f9039bee84ca9a55d23e7179213e4cdcf45bb9a8ce","observation_id":"565bc0b7-1107-4bf2-a63c-4eaa2fc6cdbe","resolution":{"observed_at":"2026-08-12T14:17:01.050540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.026287Z","title":"Practical parameterization of rotations using the expo- nential map,","venue":null,"work_id":"f1837edf-e353-4f00-8ee0-f4c22fa1ae6c","year":1998},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.631427Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:dc10b65018cb1ae6021e0475dac2f9589eb5e5e4ff866663ad4ce8c3255abe60","observation_id":"39fc4f76-241c-40fc-8312-f5c1386c57c8","resolution":{"observed_at":"2026-08-12T14:17:01.032287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.008413Z","title":"Taming diffusion models for audio-driven co-speech gesture generation,","venue":null,"work_id":"a212ef0c-d69b-4964-a8e5-64ea4297e889","year":2023},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.635471Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:47d622a4807f0cb1f46ffdb04d16fa8b8c1ffea583c4b962dc10ba4210d1b861","observation_id":"d44c918c-2f37-4e26-a2d6-407d85278394","resolution":{"observed_at":"2026-08-12T14:17:01.013824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:00.976716Z","title":"The genea challenge 2023: A large-scale evaluation of 12 gesture generation models in monadic and dyadic settings,","venue":null,"work_id":"5bcc89ac-65df-4172-ab3c-cbf078256595","year":2023},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.639971Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:2eec8d1f13a34df36b0b344f44c8308acc81901f6dfec3b0e05dddec7bdcacf0","observation_id":"d3b09697-280d-4c4d-9581-38a7a20703ca","resolution":{"observed_at":"2026-08-12T14:17:00.981585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:00.961707Z","title":"To rate or not to rate: Investigating evaluation methods for generated co-speech gestures,","venue":null,"work_id":"102eab93-db65-40fb-9a8b-add3a804bfab","year":2021},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.644152Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:55a14951a78432f3b3fe8e1b956dc894459ecc567c74006e8c41d9d8d757601d","observation_id":"cfb99d7c-b6a0-43a4-85fe-c5e4997f4efb","resolution":{"observed_at":"2026-08-12T14:17:00.966317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:00.947109Z","title":"Speech gesture generation from the trimodal context of text, audio, and speaker identity,","venue":null,"work_id":"e56c15fe-5b66-4966-8d82-8c5aab09c989","year":2020},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.648483Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:c91c8efc1b88a436e186f655a2039bc9ddfaa9cbb5338e7ca014ae7e0bcd7a53","observation_id":"4389f7b5-71ff-4654-a77a-06097ae9977f","resolution":{"observed_at":"2026-08-12T14:17:00.952051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:00.931733Z","title":"Ai choreographer: Music conditioned 3d dance generation with aist++,","venue":null,"work_id":"36e55d33-efbe-48b0-8f68-d2fa62656535","year":2021},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.652923Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:9fc5cef26a71287e44c9de2070ee92e4b833197a329e6cbbcbbb4e0ae2f1757f","observation_id":"869a70dc-467e-468c-881b-f5e31c2350a8","resolution":{"observed_at":"2026-08-12T14:17:00.937272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:00.657039Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.657039Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:720595bf6a1955969750265a34dfea18c501e3e2ec90e7a83fa0beb75a191951","observation_id":"eba4f2d5-487f-4566-ad62-ae37ac2529c3","resolution":{"observed_at":"2026-08-12T14:17:00.657039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08737","last_updated":"2024-03-28T16:59:24Z","snapshot_observed_at":"2026-07-06T15:03:48.321032Z","submitted_at":"2023-03-15T16:21:50Z","title":"Evaluating gesture generation in a large-scale open challenge: The GENEA Challenge 2022","version":2},"cited_work":{"arxiv_id":"2303.08737","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.08737","snapshot_observed_at":"2026-08-12T14:17:00.700505Z","title":"Evaluating gesture generation in a large-scale open challenge: The GENEA Challenge 2022","venue":"cs.HC","work_id":"e72267bf-c519-4930-8466-dd910e8132a7","year":2023},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.661545Z"},"links":{"cited_paper":"/paper/2303.08737","citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:937e7ba6b92c3a0cf255f83d6599e8badb55ab63c8a019a3ee068117fc9960e0","observation_id":"6d2b75ad-8681-4e54-b843-f08ba3dbf5aa","resolution":{"observed_at":"2026-08-12T14:17:00.707160Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:00.908544Z","title":"Simplifying, stabilizing and scaling continuous- time consistency models","venue":null,"work_id":"9e143101-cead-4fae-ae60-9ebbc5cf38a2","year":null},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.665972Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:6d2826362f59437fd52f0d176b5b5d7247c3944f4009ef7b9bad68ff521ab2c6","observation_id":"3c26c27f-8c1b-49f4-bf85-ef4a96858f99","resolution":{"observed_at":"2026-08-12T14:17:00.913308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-12T17:13:52.282039Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":2,"verified_fuzzy":26},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2411.16729."}