{"as_of":"2026-08-08T23:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cfbfa2f004ad0bc98a5db95809dc2dafaa74662a22b18453cbfcba47de21171a","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:00:03.310121Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.06812/citation-record","integrity":"/paper/2507.06812/integrity","json":"/paper/2507.06812/citation-record.json","paper":"/paper/2507.06812"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:04.055385Z","title":"Ahuja, D","venue":null,"work_id":"c21ea500-3aad-4df8-9385-c810dd7dcf1b","year":2020},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.099053Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:849eabc4ea99f9e43e46eaf37ca4d5fd873f3616395054214b99c66cc502d986","observation_id":"e397a11e-3382-41e3-adb0-84f94fd59a98","resolution":{"observed_at":"2026-08-06T19:00:04.059275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:04.042231Z","title":"Karras, A","venue":null,"work_id":"4a87051a-e4e5-4a2d-8ef0-44c2db06dbe8","year":2023},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.103692Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:396d5d228b94d555fedab8bde8b290639f825268143602a872a0ed86535c0491","observation_id":"7c969f93-a8e8-4f67-a2d7-d6185a9eda3a","resolution":{"observed_at":"2026-08-06T19:00:04.046484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:04.028942Z","title":null,"venue":null,"work_id":"b6f6435f-1201-4faf-8c23-b7fcc60ce747","year":2022},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.107902Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:b1fb3f1eacd7fb8a36f1c996187ed8e4b95561db45c25b328b7217a7a2aef182","observation_id":"11482555-022a-4990-b9f8-087d7a4d770c","resolution":{"observed_at":"2026-08-06T19:00:04.033006Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:04.015526Z","title":"Bookstein","venue":null,"work_id":"5418e8bf-facf-4702-998b-e2e71978d000","year":1989},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.112829Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:25b3752d14c2f98cee73d5255b96276401630f142e690083b68b5043f7c0267b","observation_id":"62a937de-34cb-43a1-8381-b3fb3ccee329","resolution":{"observed_at":"2026-08-06T19:00:04.019948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:04.002960Z","title":"Tevet, S","venue":null,"work_id":"86498a70-4501-4a72-b844-78dcd526085d","year":2023},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.117645Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:9f41dc3f22c729162c083a923fc3f222b226ae93fd7bf7fb2c3bfadff582bbfc","observation_id":"f9ebc668-e5b7-4c6a-83c7-f66915019583","resolution":{"observed_at":"2026-08-06T19:00:04.006821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.990205Z","title":null,"venue":null,"work_id":"4c9831b3-b420-4f58-a783-b2a0ab15d427","year":2019},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.121647Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:588b00a794f47b63f813b22f86e78c367870ec0ed931fcb27770591230ff30eb","observation_id":"b7817e8d-0cb9-4123-a944-bb1798a1037e","resolution":{"observed_at":"2026-08-06T19:00:03.994115Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.977143Z","title":"Siarohin, O","venue":null,"work_id":"3e44ba6c-e303-4e08-a2a2-33248aa2f346","year":2021},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.126199Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:e8c4529143f90d0907edf99f945902370f48df7fea00339ecb81fe1c29c9feb0","observation_id":"a40de607-8428-4c6d-92d2-ba4731c1cad1","resolution":{"observed_at":"2026-08-06T19:00:03.981425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.964140Z","title":null,"venue":null,"work_id":"b388415a-9837-4771-b8b3-6d4deec2d547","year":2022},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.129893Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:87732867fe646614566bc17b39b70d698efb5fd4633954f5e38e09f2e9e2a833","observation_id":"5265bfc4-f43b-4c2d-99b1-c2b67808dde8","resolution":{"observed_at":"2026-08-06T19:00:03.968157Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.951375Z","title":null,"venue":null,"work_id":"d45992da-798b-4950-8816-c5787374ec4b","year":2017},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.133995Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:01b2b5b4e5a0b3d3e5a6237674c5162e9d880aa813abdf803ce26b4b7523c223","observation_id":"b8e5bc8f-4db7-4235-b5be-6572100b61d3","resolution":{"observed_at":"2026-08-06T19:00:03.955311Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.937329Z","title":null,"venue":null,"work_id":"b1928e83-51f2-480d-86c3-ee4c7e712446","year":2023},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.138098Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:8b0f4264952b8d2ac09db89816920a5e28cec1f966b1caf0a53f0501b6becf2b","observation_id":"2c526cd3-e787-41b9-bc99-db1d54f7c13f","resolution":{"observed_at":"2026-08-06T19:00:03.941921Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.922944Z","title":"Siarohin, S","venue":null,"work_id":"fd520d8f-38b2-4515-aeb0-fcdbd9c15a13","year":2019},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.142761Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:e8da84d736fbcbae88c9d99445dbee1b799e7f85871093bc0eb00700bd8f6362","observation_id":"9c15d8b5-bd42-4e7c-939b-2b6bb485fb46","resolution":{"observed_at":"2026-08-06T19:00:03.927897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.909806Z","title":null,"venue":null,"work_id":"982e3ddc-b70a-4653-a9a3-f6360709eb8c","year":2020},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.146695Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:c2a3ec5077850e7da159564ca6692db827934ffe2ac8656f18838f739d9c6e44","observation_id":"78886055-ef8a-4699-98bc-bc2b5118b819","resolution":{"observed_at":"2026-08-06T19:00:03.913908Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.896890Z","title":"Vaswani, N","venue":null,"work_id":"45f6b677-c553-4aac-9801-4774a82f60d8","year":2017},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.150364Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:b0b3a54b88af19055a3b18dc41927d9fea48af0d0a888db85075a62bd3c01702","observation_id":"ff8dd3e8-5e7e-4239-afd4-32a124980e1e","resolution":{"observed_at":"2026-08-06T19:00:03.900910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.883975Z","title":"Kingma, J","venue":null,"work_id":"f8be9f53-50b8-4bc5-8f98-b312b1be505b","year":2015},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.154315Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:9b9a4c7316f94e49bba989d9dab46179d77dc755d40aa96652db44700a143517","observation_id":"62368d81-ca39-4d86-916a-dd05342ec179","resolution":{"observed_at":"2026-08-06T19:00:03.887961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.871005Z","title":"Unterthiner, S","venue":null,"work_id":"96148d8f-0e34-4ea8-9eca-bda4eede6c7f","year":2019},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.158287Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:f6f0428b50ed72f2347fe3737dc97c5fd95415aa670dee79f428c7bbce231e42","observation_id":"ddfc9077-40da-48ef-bf8e-9e609caa3dfc","resolution":{"observed_at":"2026-08-06T19:00:03.875152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.858342Z","title":null,"venue":null,"work_id":"e54ef689-6bb5-4229-a96a-3ae7a6aecbe4","year":null},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.162030Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:ba62061f8c2ef3d9f482c5c63a9b4b55ff317d835b4e8b4e8306ce7b9faa0a1f","observation_id":"1496ff46-de19-45cb-a892-00199a308d9f","resolution":{"observed_at":"2026-08-06T19:00:03.862274Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.845784Z","title":"Rombach, A","venue":null,"work_id":"4fe50df3-b92d-4cc2-b11c-659bd2d08d65","year":2022},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.165973Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:f8172dff13d7368e2172f540e6f651ba71457e3a29deafb84484231dc94816e9","observation_id":"4b53fd32-833b-46bd-a570-90a1f8a7afe7","resolution":{"observed_at":"2026-08-06T19:00:03.849737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.831987Z","title":"Hogue, C","venue":null,"work_id":"f73cbc63-f920-479a-8f4b-e79723c2321f","year":2024},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.169702Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:a025865b6c52ee7623344b7458ea4f7e5b9279ce23d55ddea00ac1f054fc802c","observation_id":"52a801c5-0f06-440c-acb7-8e69abf0a69f","resolution":{"observed_at":"2026-08-06T19:00:03.836686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.819371Z","title":null,"venue":null,"work_id":"ac880a0a-8e94-4f87-bef5-40a2ebd403d8","year":2024},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.173869Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:3903836d2d9f663438b15f0439f0f63922551158b8a9a318dee9be0300e97b65","observation_id":"e5cc20d6-9ba5-4a43-b296-69f884f260c8","resolution":{"observed_at":"2026-08-06T19:00:03.823259Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.806456Z","title":null,"venue":null,"work_id":"90ae942b-353c-421c-9b24-4c7bcccd8adc","year":2024},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.178068Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:5bcf361b5fa222588ac0d98dc0fe9650e47a56b2ab52e8b664b752778824d0fa","observation_id":"fb79a80b-6fa0-497a-b8a3-e938ce2adc0f","resolution":{"observed_at":"2026-08-06T19:00:03.810373Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.793613Z","title":"Zhang, J","venue":null,"work_id":"8163d548-014c-4731-81eb-b8ba65d59385","year":2024},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.181834Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:859b5d545f44deb7e8d6f17505906d78d23bf47e47393335a63bef2f8a4bd047","observation_id":"34a0be0b-598f-47d6-9197-ec10ffe4ad0e","resolution":{"observed_at":"2026-08-06T19:00:03.797658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.780614Z","title":null,"venue":null,"work_id":"b48b9427-9129-4a02-b120-0b88e2490da8","year":2024},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.185647Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:cfbe77498e1ed6cca865e34e43f8228eedc55e62184cea74499fdd41561d8ffa","observation_id":"f10664eb-a17c-4376-b9b4-77b11e69f752","resolution":{"observed_at":"2026-08-06T19:00:03.784596Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.767344Z","title":null,"venue":null,"work_id":"0f6414b6-46c5-47ec-b300-b859e758665d","year":2025},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.189426Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:ae9f458b0dd4571d3d91a54de964253fabffce993ab9e90cc0f6a570489b3e41","observation_id":"e69d6b9f-3fc6-46b4-b310-055204548e13","resolution":{"observed_at":"2026-08-06T19:00:03.771654Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08764","last_updated":"2024-03-13T17:59:02Z","snapshot_observed_at":"2026-07-06T17:44:09.081164Z","submitted_at":"2024-03-13T17:59:02Z","title":"VLOGGER: Multimodal Diffusion for Embodied Avatar Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08764","snapshot_observed_at":"2026-08-06T19:00:03.193055Z","title":"Corona, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.193055Z"},"links":{"cited_paper":"/paper/2403.08764","citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:b148f5fae674bc1c0266d4777796a286761be670e2b1933e4733a33ce709e522","observation_id":"55ba466d-8195-47bc-870d-cab19cd2a9c5","resolution":{"observed_at":"2026-08-06T19:00:03.193055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.754471Z","title":"Peebles, S","venue":null,"work_id":"861c9da6-81df-44a9-ae2e-62116135c974","year":2023},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.197884Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:9013f32738e501aedee08d32a74f4eefe2941fc0f32bc934e5312ec2aef970ed","observation_id":"de539990-03fd-4b57-8892-8ed5e30ef364","resolution":{"observed_at":"2026-08-06T19:00:03.758497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.741265Z","title":null,"venue":null,"work_id":"3c6820be-3e4a-4b3e-8368-7def34fd3af8","year":2021},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.201515Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:1256d8712200a946ed74470ff3c5653a69b43698643e56cc1607d62ffc91e005","observation_id":"4b6a3585-a1f0-4fc1-adab-350ea02e87f1","resolution":{"observed_at":"2026-08-06T19:00:03.745297Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.727515Z","title":null,"venue":null,"work_id":"f2fde2eb-0557-49b0-87a0-f474e7108994","year":2024},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.205100Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:d21873ae298e35dc1f28f7b6dd1abac0d209e62e9dae264ae3077703be983c79","observation_id":"189ab334-c7ae-4f2f-9403-c98ca6a93d0b","resolution":{"observed_at":"2026-08-06T19:00:03.731716Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.714885Z","title":null,"venue":null,"work_id":"2d986399-2e4a-43af-b70b-42c11887c8f7","year":2025},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.208900Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:4762eb960c990635738a46b870a27fbf3a8d47411601e979182d975311441755","observation_id":"6ffc950d-6cf4-4ce1-8dae-e627274dc68c","resolution":{"observed_at":"2026-08-06T19:00:03.718798Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.701137Z","title":null,"venue":null,"work_id":"e15f84b2-dbd5-49bb-9e52-32b7ac486ff3","year":2024},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.212459Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:fd57636e2038a644e4c76a0f2cd68abf5b107d9e3a38d7076dc3d8c2f3253611","observation_id":"168d741f-a4b1-4368-833b-d68825b9bd04","resolution":{"observed_at":"2026-08-06T19:00:03.705580Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.688297Z","title":null,"venue":null,"work_id":"15e7b264-dfe0-4be7-a1b4-5cdef4984401","year":2024},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.216027Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:7436522eb8bf4fbc0c9504e1f06dcc8c13ce97fdde94876d7e2f03fade2fb8b1","observation_id":"d3a2f59b-41eb-4c04-b2ea-e7543a5acaef","resolution":{"observed_at":"2026-08-06T19:00:03.692317Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.675578Z","title":"Loper, N","venue":null,"work_id":"104f9920-736c-4c38-8401-472e90183106","year":2015},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.219994Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:50145ceabf36edda027aac4dee122b6b6e2fa8f3364f73315f4640f7b81759ff","observation_id":"2754de39-7196-4eac-85f3-4a3bfcce0c74","resolution":{"observed_at":"2026-08-06T19:00:03.679593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.661912Z","title":"Pavlakos, V","venue":null,"work_id":"4b57d472-9d18-40c2-990b-9397a0acfe29","year":2019},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.223679Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:3fad1b5a9c2fd863eff797ce5b21867876f0358002414d910a7a9f8d19a67ec6","observation_id":"25af7d10-0aa2-48d9-9840-4572428cff8e","resolution":{"observed_at":"2026-08-06T19:00:03.666187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.648230Z","title":"Karras, T","venue":null,"work_id":"0a03110e-bd59-49ae-87eb-ac9f657d2b6a","year":2018},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.227368Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:4fa397860d9b56c17532196d1483cbfb1a07e21104f30700ee7acebbcc60dadf","observation_id":"808b0200-c70c-4fe8-939c-3c3af0751ec1","resolution":{"observed_at":"2026-08-06T19:00:03.652655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.634200Z","title":null,"venue":null,"work_id":"b9761845-945d-4987-9ed6-62d7792744f7","year":2022},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.231222Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:f1a2e2a9f610e446363e787907a4e1d4106adb5ba9133f11dd747e87eefcba57","observation_id":"484fe708-2076-4b65-a7ba-6a3405ef1442","resolution":{"observed_at":"2026-08-06T19:00:03.638885Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.620464Z","title":"Serengil, A","venue":null,"work_id":"cb8b9669-2e75-4af6-85a2-b326b10fb484","year":2024},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.235009Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:664ac949b04624dfb55a9e084fc57ec274c3a90f07797a62205668c21497e2f1","observation_id":"44dbe658-cf0f-4d6d-a8f6-24f5ee19c135","resolution":{"observed_at":"2026-08-06T19:00:03.624485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.607173Z","title":"G ¨uler, N","venue":null,"work_id":"45293d18-5c85-4db2-8985-0e47c8e13df5","year":null},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.239450Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:9f78a83a58ffcc26c48d3bc4d5e048a55ae83f594da0befda7d57b73e9224bec","observation_id":"5cc6a605-b13e-4383-bb00-65e0aaa4fb9a","resolution":{"observed_at":"2026-08-06T19:00:03.611641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.593506Z","title":"Zhang, X","venue":null,"work_id":"728cb0ea-a071-4194-b0ec-aac02c3a38c3","year":2023},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.243805Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:3a0598e949e7a68c46e72ce7f67b93344886448d10dbf8b7a449ea35da4e8da5","observation_id":"97db8ac1-5ee3-4747-aa2f-f93e2bf1619a","resolution":{"observed_at":"2026-08-06T19:00:03.597481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-06T19:00:03.247582Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.247582Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:def19c6a79b3d9889d0202137ac0a9780d05ab9d2a82faa0dcbc9d82eca7f852","observation_id":"2b7a5166-c530-4d93-928f-bb09d9a70d22","resolution":{"observed_at":"2026-08-06T19:00:03.247582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.580897Z","title":"Egger, W","venue":null,"work_id":"411634ac-56dc-45b4-aa07-cfe40fd0fdfc","year":2020},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.251398Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:63067f99e830aa4b6a1ce92455c12b4c6b5021eb9d2d96814ed5769f68cf3afa","observation_id":"b9142ff7-35b4-421e-ae4b-8c85b1a61115","resolution":{"observed_at":"2026-08-06T19:00:03.584838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.568673Z","title":"Heusel, H","venue":null,"work_id":"e348e650-c777-4617-9ac1-2a6a35890db9","year":null},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.254918Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:b4f27734fd188617ab15abca34fe92caca9e4641209ab0b468dcc8bdd39f72d4","observation_id":"0acbe176-d9fa-47d0-ac2d-4444dd998ee6","resolution":{"observed_at":"2026-08-06T19:00:03.572778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16748","last_updated":"2026-05-08T09:16:59Z","snapshot_observed_at":"2026-08-04T02:06:42.093429Z","submitted_at":"2024-11-24T04:46:00Z","title":"Multimodal Diffusion Transformer with Memory Bank for Scalable Long-Duration Talking Video Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16748","snapshot_observed_at":"2026-08-06T19:00:03.258656Z","title":"Zhang, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.258656Z"},"links":{"cited_paper":"/paper/2411.16748","citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:e6f14ed504f7291c34581c2d7bcd79d61da735823de0bba70eedf5982a6faac3","observation_id":"9a96e6d5-6c46-4561-a210-f735e3a79463","resolution":{"observed_at":"2026-08-06T19:00:03.258656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.555891Z","title":null,"venue":null,"work_id":"3c60ddf8-8f33-4dcc-9c11-baf29d6b4078","year":2025},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.262813Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:10176494c3bc3680b8b352981ffad3b149bdb462fcedd5b653cc2b87a69b1649","observation_id":"d720ba92-a91d-4744-9194-d36f5b5d4616","resolution":{"observed_at":"2026-08-06T19:00:03.560127Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T19:00:03.266317Z","title":"Achiam, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.266317Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:b9def5d4ee0a4c4c738ba6a822f22481ada8be94396b86f2906ce126f2daedb7","observation_id":"16627d71-ede3-4e22-9215-59f16931d47c","resolution":{"observed_at":"2026-08-06T19:00:03.266317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.542111Z","title":null,"venue":null,"work_id":"c84375c4-41ed-408f-82e8-8a75664bcaa4","year":2020},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.270226Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:be9c0cc1a79dd65680019214ca8f66b9c39dffacf3ba6602328d2293fca71d85","observation_id":"83e964ee-da08-4aeb-8445-3e09ab9675e7","resolution":{"observed_at":"2026-08-06T19:00:03.546255Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.529346Z","title":"Plaquet, H","venue":null,"work_id":"51f64d08-e007-4aa7-8945-8e0799486503","year":2023},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.273966Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:d85c026aa893200d627a237184115a1a7c79c88330065e4288eb18f8b942480c","observation_id":"74484def-2e20-4f79-9e7f-0eb901c80a87","resolution":{"observed_at":"2026-08-06T19:00:03.533273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.516246Z","title":null,"venue":null,"work_id":"dbaf2cff-5cc0-496a-a94d-0531510efdc2","year":2016},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.278085Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:238f85c821f7d1bbff3e4d8fc603610746d9e49969371db2cfbe1bd45a4a1053","observation_id":"a2b315ce-53c9-4348-8c9d-90dd7601aece","resolution":{"observed_at":"2026-08-06T19:00:03.520208Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.502546Z","title":"Baevski, Y","venue":null,"work_id":"e082c38d-dc0f-4ec4-b942-a80a02acefed","year":2020},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.282259Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:7995aa29a94fb74fcd5e28274bb403331205415cbda107bede0ffe0b2296a095","observation_id":"f28bcbca-7558-4ac4-bba2-fbcc0f4934ae","resolution":{"observed_at":"2026-08-06T19:00:03.506410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.489462Z","title":null,"venue":null,"work_id":"b43e537e-aeda-4eef-b7ae-0ad0faf6fa10","year":2021},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.286791Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:4a26bb8c41dfabb293f5a9c924de0ccab1341a55e0863a80f36ba456c3d0a431","observation_id":"6d7e2ef8-cdaa-4d35-88c0-2e1e20beef63","resolution":{"observed_at":"2026-08-06T19:00:03.493440Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.473990Z","title":null,"venue":null,"work_id":"26eeaea6-4d36-4c3f-8044-d372c50b6b6f","year":2025},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.290590Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:d88e27bb493d6fef86ac42c10622803a5b9a7fa5cfd650527226f144677707a3","observation_id":"d0276baf-c198-4127-8785-ef343f310660","resolution":{"observed_at":"2026-08-06T19:00:03.478657Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.459067Z","title":null,"venue":null,"work_id":"ba6badf7-e75d-410a-8389-fb64d7b13753","year":2024},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.294355Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:94d1418f938654fc70e58dde94c668b87376cba75fe170ee56754eba04204205","observation_id":"29ff45fb-3beb-46c5-93dc-9f2fc4a7118e","resolution":{"observed_at":"2026-08-06T19:00:03.463407Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.444673Z","title":null,"venue":null,"work_id":"fd7dfbd0-7aac-412e-a376-ff6bb94acce5","year":2024},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.298082Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:755a356ec1fc526a7280560bd5c66a4d2ed0cd73773f061dbd01bfe918ae6a4a","observation_id":"38a67781-8d06-4e7b-bb61-3df53cf99e5f","resolution":{"observed_at":"2026-08-06T19:00:03.449283Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.431068Z","title":"Huang, F","venue":null,"work_id":"871e7a8d-a12f-447f-b540-f23d883c095a","year":2024},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.302012Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:8ec36d7b17019b2eaf7861f4827b7e7f072d9b3bff3bf04ab8a93bff03921e35","observation_id":"e2fa75d6-d3f8-42a5-9c91-eb558cd19c7a","resolution":{"observed_at":"2026-08-06T19:00:03.435066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.416984Z","title":null,"venue":null,"work_id":"baf5b1f9-7ee3-4242-bcf4-48e02f946810","year":2004},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.305819Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:c3ac2e0c45bd9bf3db5600b17eb55185a70a88981f130c2a997c3ed0165e9d80","observation_id":"75838da0-39d5-4ac9-910a-40a566ccfe56","resolution":{"observed_at":"2026-08-06T19:00:03.421887Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:00:03.401347Z","title":"Hor ´e, D","venue":null,"work_id":"3bbd1d48-f539-4882-a340-79a8879516c5","year":2010},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.310121Z"},"links":{"citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:944a4fa7f6104e8ff7144b8631c27cc48f66223fe733445b8493432017cf62eb","observation_id":"6965c2cd-620c-4373-abf7-546499c6739d","resolution":{"observed_at":"2026-08-06T19:00:03.406622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2507.06812."}