{"as_of":"2026-08-07T10:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:167b710744d9ddbf818fa15744a49c150b384b43a292bdf3528293ce8d1085bd","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:07:28.484954Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.20987/citation-record","integrity":"/paper/2507.20987/integrity","json":"/paper/2507.20987/citation-record.json","paper":"/paper/2507.20987"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-08-06T13:07:28.255179Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.255179Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:c0c1e797f27a2c087c4c3c33d09b6f8df1f387d0b9130cb406c15d4a251e7e3c","observation_id":"9f8eb8eb-c408-4fb3-bb91-927714cba40b","resolution":{"observed_at":"2026-08-06T13:07:28.255179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-06T13:07:28.260898Z","title":"Blattmann, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.260898Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:ac084f269ce80cb7dfbe0ddb8a136369af412076b13a976a11d8d880e44b9c1b","observation_id":"cd26a3e6-2448-4370-a2b4-b2a57e88ba75","resolution":{"observed_at":"2026-08-06T13:07:28.260898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:29.513413Z","title":"Caron, H","venue":null,"work_id":"11554530-8cfe-424f-ab21-98e3f7ae0964","year":2021},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.266713Z"},"links":{"citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:8ad2890180a7a1b98dd25228be2e9fdf8a5d1070dca668907724cf24c3ffa5a7","observation_id":"aec1f845-f6cc-4662-82f3-f749f6d011ae","resolution":{"observed_at":"2026-08-06T13:07:29.518833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-08-06T13:07:28.271561Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.271561Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:ff6a9caba9e96471f795e4e158c39b72d87ef63aa6921c70605fab9ddc54fb3c","observation_id":"9ba859d9-ee81-4060-baff-24242d4ea042","resolution":{"observed_at":"2026-08-06T13:07:28.271561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00733","last_updated":"2025-03-13T08:23:27Z","snapshot_observed_at":"2026-07-06T19:59:37.692710Z","submitted_at":"2024-12-01T08:54:30Z","title":"Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Video Diffusion Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00733","snapshot_observed_at":"2026-08-06T13:07:28.276988Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.276988Z"},"links":{"cited_paper":"/paper/2412.00733","citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:1f39488e78dd6ca8911bc044afc1d16eb0df3537a68ca712c8e2b23da62e7d14","observation_id":"46495ded-d986-48ff-b43c-3b6fce0f7863","resolution":{"observed_at":"2026-08-06T13:07:28.276988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:29.496510Z","title":"DeepMind","venue":null,"work_id":"1e042cf3-dfea-4fd6-b285-7b8493bd7cf1","year":2025},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.282867Z"},"links":{"citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:cb8ea1c06b3cc397f79da9a722a92d2c34a22b2daff3e72638253e5d13c85f49","observation_id":"dc3a77a5-34c6-4bfa-8977-54a8de14198f","resolution":{"observed_at":"2026-08-06T13:07:29.501595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:29.478292Z","title":"Eleven Multilingual v2: A foundational multi- lingual text-to-speech model supporting 29 languages","venue":null,"work_id":"3e311386-22bb-42d1-817f-68ec9fecf38f","year":2023},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.288087Z"},"links":{"citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:90f4404a6d47d13d952d2aaaac8661a780a98928922c3760d5bbcd1c5c359300","observation_id":"90e4fa50-9a9a-4a34-b8f1-b5d945e5cd43","resolution":{"observed_at":"2026-08-06T13:07:29.483611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:29.460041Z","title":null,"venue":null,"work_id":"c94551aa-7f8c-4f78-b218-cdb75d9086ce","year":null},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.293808Z"},"links":{"citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:f169ef9532d525e108a7c93d4ae61c6c02fe5027133e6bad6643a8cff02f487f","observation_id":"0d58c0c6-b868-4e86-a62e-335215e975b1","resolution":{"observed_at":"2026-08-06T13:07:29.464930Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:29.442934Z","title":null,"venue":null,"work_id":"ba5dcb3e-9f0c-4635-b4a3-c6514be72db9","year":2022},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.298680Z"},"links":{"citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:e9a43bfe68e5570480dbe0d7bb34802d5589282eb4aa2e9b392cbe929e91020c","observation_id":"8e0641f0-7e13-4a3d-92ce-7959a053128d","resolution":{"observed_at":"2026-08-06T13:07:29.447808Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-06T13:07:28.303813Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.303813Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:f2cd1ffad866bdcfa090da52177fb759a4e24cfbe7bab0c6bb5208fb374519c9","observation_id":"bb966614-8d46-43d4-8541-a0b8d25470cc","resolution":{"observed_at":"2026-08-06T13:07:28.303813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11251","last_updated":"2025-03-14T10:01:55Z","snapshot_observed_at":"2026-07-06T20:52:37.081347Z","submitted_at":"2025-03-14T10:01:55Z","title":"Step-Video-TI2V Technical Report: A State-of-the-Art Text-Driven Image-to-Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11251","snapshot_observed_at":"2026-08-06T13:07:28.308903Z","title":"Huang, G","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.308903Z"},"links":{"cited_paper":"/paper/2503.11251","citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:2fbaaf93566e86fa421f7709c671467b9904e8cd25400868fcc3e48c40473ee4","observation_id":"5b8e0228-cbc8-4122-ac5a-358bf6dfcf9c","resolution":{"observed_at":"2026-08-06T13:07:28.308903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:29.425466Z","title":"Huynh-Thu and M","venue":null,"work_id":"0e0525f1-a768-4021-91f9-9ae96a19aa9a","year":2012},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.314402Z"},"links":{"citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:7b19a98630edb1dc5357840f2c12a69d3ba626b38d68303a2a480059767d64cd","observation_id":"c62460bc-87fe-4d26-96fc-13a071ce6405","resolution":{"observed_at":"2026-08-06T13:07:29.430380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16331","last_updated":"2025-06-05T11:49:59Z","snapshot_observed_at":"2026-07-06T19:56:30.344759Z","submitted_at":"2024-11-25T12:24:52Z","title":"Sonic: Shifting Focus to Global Audio Perception in Portrait Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16331","snapshot_observed_at":"2026-08-06T13:07:28.320448Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.320448Z"},"links":{"cited_paper":"/paper/2411.16331","citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:680cd6aa1bcf103312a7a282f8a1861d3ae32fcc18a346a2ddfaddf02ff8f8a5","observation_id":"d7897926-fa51-4621-b3e6-b33f79123df8","resolution":{"observed_at":"2026-08-06T13:07:28.320448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02634","last_updated":"2025-04-04T05:13:40Z","snapshot_observed_at":"2026-08-05T07:44:02.175955Z","submitted_at":"2024-09-04T11:55:14Z","title":"Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02634","snapshot_observed_at":"2026-08-06T13:07:28.328153Z","title":"Jiang, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.328153Z"},"links":{"cited_paper":"/paper/2409.02634","citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:2d9f3786520f31d3b627015185a2f2309826473e763d59ea66fc025bdbba156d","observation_id":"466c15f3-68e5-430a-a523-6f0b68f7208f","resolution":{"observed_at":"2026-08-06T13:07:28.328153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:29.407581Z","title":null,"venue":null,"work_id":"f3101cc7-8210-4c35-8061-be5496e07383","year":2021},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.336008Z"},"links":{"citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:9cbb079f5c52e4bc846d3426dbda1919c9a7cfc5d8a9b7f2fe460a55f1f0bc48","observation_id":"21564f20-7b37-41e5-a88a-01c967b8ac72","resolution":{"observed_at":"2026-08-06T13:07:29.413034Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-06T13:07:28.341053Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.341053Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:b1d742ef30d83b01081b013147024767240d1af908710624adf095db0d82eddf","observation_id":"9aad734f-4aa9-49d6-b058-f8c508a0b8d1","resolution":{"observed_at":"2026-08-06T13:07:28.341053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:28.346244Z","title":"Laion aesthetic predictor.https : / / github.com/LAION-AI/aesthetic-predictor,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.346244Z"},"links":{"citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:20559145f20f906335d3131184fdf495b32f43988f5aa9d86f87d4432f27576d","observation_id":"1a359396-9b3a-4e95-887c-2bf2ba39097f","resolution":{"observed_at":"2026-08-06T13:07:28.346244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-07-06T20:05:55.982214Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-08-06T13:07:28.356402Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.356402Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:e6b563fa9c2d3025b46fe1087f18b1b1cbe1ed5ec5aa57b7c27616bf9bb23af6","observation_id":"00912a17-7a4f-48c1-b26c-328ee3e8e517","resolution":{"observed_at":"2026-08-06T13:07:28.356402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00398","last_updated":"2023-09-07T08:11:01Z","snapshot_observed_at":"2026-07-06T16:13:15.274672Z","submitted_at":"2023-09-01T11:14:43Z","title":"VideoGen: A Reference-Guided Latent Diffusion Approach for High Definition Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00398","snapshot_observed_at":"2026-08-06T13:07:28.361100Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.361100Z"},"links":{"cited_paper":"/paper/2309.00398","citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:f087d7f73f2f6f7257fc9f145af03fcee6f332fe737e2078577fc853db69d094","observation_id":"c6c8752d-af4f-44c6-848d-8be9cc31a660","resolution":{"observed_at":"2026-08-06T13:07:28.361100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:29.360647Z","title":"Li, Z.-L","venue":null,"work_id":"937abb9e-16b4-44b5-8e98-772c34e5a4b5","year":2023},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.366070Z"},"links":{"citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:1de6ed1e6d9c72fc4bdb35296fb3cb89cf3da09c11c6a6b10139e9c1de473719","observation_id":"6d7bc63b-cc26-415a-8776-22e95544bb13","resolution":{"observed_at":"2026-08-06T13:07:29.365371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:28.370814Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.370814Z"},"links":{"citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:1bf02019d03ff78ed2c0bce99e0f35770b33ff6a18e3d5f8b064f565e8d8ef95","observation_id":"5071510a-7b7c-4f9b-ae7e-6bffc5a1d227","resolution":{"observed_at":"2026-08-06T13:07:28.370814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-07-06T21:32:38.137341Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23009","snapshot_observed_at":"2026-08-06T13:07:28.375424Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.375424Z"},"links":{"cited_paper":"/paper/2505.23009","citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:1099b9275660e15263b11b2d135571a4b9e4c7191a392e118d1f845074fa16e2","observation_id":"493cbbe6-407d-4264-9cb9-17e1b0a7a46d","resolution":{"observed_at":"2026-08-06T13:07:28.375424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:28.384776Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.384776Z"},"links":{"citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:2f5a67b0687903685c5e041df44cc3e62e4c33c89ae00b5aabca5fd1c7e43ac2","observation_id":"249acc42-76b7-431f-9846-9f602c448da1","resolution":{"observed_at":"2026-08-06T13:07:28.384776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10922","last_updated":"2024-03-15T08:48:04Z","snapshot_observed_at":"2026-07-06T13:44:37.384708Z","submitted_at":"2022-08-23T12:49:01Z","title":"StyleTalker: One-shot Style-based Audio-driven Talking Head Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.10922","snapshot_observed_at":"2026-08-06T13:07:28.389538Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.389538Z"},"links":{"cited_paper":"/paper/2208.10922","citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:3a19d021004479948b5f5d04e558a5cf744a6569df9cc5d1e1897aa4f1753977","observation_id":"d65ff508-4c87-4cf0-bbb2-a3828f0ab2e5","resolution":{"observed_at":"2026-08-06T13:07:28.389538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:29.327363Z","title":"GPT-4o-Mini- Audio-Preview: A compact, cost-efficient audio-capable 5 multimodal model","venue":null,"work_id":"81264ffa-77f1-4a98-acf7-132b769ed223","year":2024},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.394030Z"},"links":{"citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:61616103af6672c5f215e80b360a6b08dfcb8fe82cf1dabb5ac145e2bef9b9ff","observation_id":"4b24eed8-d9d4-4bcd-9af6-f624f2a4b329","resolution":{"observed_at":"2026-08-06T13:07:29.332694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09642","last_updated":"2026-03-02T11:31:23Z","snapshot_observed_at":"2026-08-02T11:33:41.662779Z","submitted_at":"2025-03-12T05:00:07Z","title":"Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09642","snapshot_observed_at":"2026-08-06T13:07:28.398657Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.398657Z"},"links":{"cited_paper":"/paper/2503.09642","citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:c94a15ae74ea1e77952dd393fe0622cc60b29d789276915da286cf66f0c3c6c2","observation_id":"c36f0941-a34f-487b-9951-f4a20911b540","resolution":{"observed_at":"2026-08-06T13:07:28.398657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:29.311118Z","title":"Prajwal, R","venue":null,"work_id":"730b476f-3092-4f4f-84f5-0fa40a15ceb9","year":2020},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.403719Z"},"links":{"citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:2d28759b62c9fe028f1eeae2fa955aa6063cdd2d6ab81ab41598a1a6a4102854","observation_id":"5625fff3-0bf1-40cd-92e9-1fc6ebba0e6f","resolution":{"observed_at":"2026-08-06T13:07:29.316252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08714","last_updated":"2025-07-27T04:08:12Z","snapshot_observed_at":"2026-08-05T07:14:44.515736Z","submitted_at":"2025-03-10T08:38:25Z","title":"Versatile Multimodal Controls for Expressive Talking Human Animation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08714","snapshot_observed_at":"2026-08-06T13:07:28.408107Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.408107Z"},"links":{"cited_paper":"/paper/2503.08714","citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:9e88959fac4d64bf4a18bdd27a64bc64c1ae1e3bdedec6598755786cfca095f2","observation_id":"08efa263-aea2-490e-922e-01498341bd55","resolution":{"observed_at":"2026-08-06T13:07:28.408107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10841","last_updated":"2025-02-15T16:08:40Z","snapshot_observed_at":"2026-08-03T18:37:17.161370Z","submitted_at":"2025-02-15T16:08:40Z","title":"SkyReels-A1: Expressive Portrait Animation in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10841","snapshot_observed_at":"2026-08-06T13:07:28.413224Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.413224Z"},"links":{"cited_paper":"/paper/2502.10841","citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:ad49847d0289b64d2c77396d959381e4b425fc3f2953df8dbdb5791d1347440c","observation_id":"012c4635-443b-4b3d-a756-32c02e46e51c","resolution":{"observed_at":"2026-08-06T13:07:28.413224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:29.293700Z","title":"Radford, J","venue":null,"work_id":"69a8bc98-32b2-4b86-ae77-020f04d32d2d","year":2021},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.418061Z"},"links":{"citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:e1c646803a509e4e08ca08f9a22a72e0336b44f32f5de24997d780454dd201da","observation_id":"5c9c5499-7162-41be-8e14-9bfc4b43b05a","resolution":{"observed_at":"2026-08-06T13:07:29.299281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-06T13:07:28.422653Z","title":"Singer, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.422653Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:46c416d59dd1c8c5ee7423545f47151a77e768a1e2ff681e547d4efa69ebb96d","observation_id":"1d1b5d94-8103-4b62-a707-d8b6ac5e2323","resolution":{"observed_at":"2026-08-06T13:07:28.422653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:29.276533Z","title":"Bark: Text-prompted generative audio model","venue":null,"work_id":"93dbfebc-010e-469c-a68f-81003f943649","year":2023},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.427315Z"},"links":{"citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:d0a3c768c67c1f9cb8bf5e86e7953bc195abcb5d5ee55e8c8b633e92dd5a3f4b","observation_id":"f891e8f8-1f30-426a-85e8-3b82099ddc4f","resolution":{"observed_at":"2026-08-06T13:07:29.281309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:29.258939Z","title":"Teed and J","venue":null,"work_id":"a8a44987-7aba-40a8-9202-e340fb6c879b","year":2020},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.431928Z"},"links":{"citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:0e36bc0a0a2dedc14a7ec886c29eded554b5d3a4c003252a1c9b14aeb524a53f","observation_id":"fafa85cc-e0c0-4ce5-850c-464e45134edd","resolution":{"observed_at":"2026-08-06T13:07:29.263605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:29.242355Z","title":"Google introduces stable gemini 2.5 flash and pro, previews gemini 2.5 flash-lite.The Economic Times (India)","venue":null,"work_id":"d732b0d9-e009-4ddc-8956-a8ef3e8a2f6b","year":null},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.436864Z"},"links":{"citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:f554959949eb9f613d695e4afc4a738beae1ceac8df513098765c784ae03bbb6","observation_id":"4494dd48-0f1b-4b3c-bb72-5b9b09201c56","resolution":{"observed_at":"2026-08-06T13:07:29.247728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17697","last_updated":"2024-11-27T07:39:20Z","snapshot_observed_at":"2026-08-06T12:03:20.133598Z","submitted_at":"2024-11-26T18:59:22Z","title":"StableAnimator: High-Quality Identity-Preserving Human Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17697","snapshot_observed_at":"2026-08-06T13:07:28.441776Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.441776Z"},"links":{"cited_paper":"/paper/2411.17697","citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:b66759829528163775a182d9b904e6fa84f73fed6d930bfe1acbc0e5cb3f20b0","observation_id":"17262ae0-cc5e-4735-ba82-327d2cc7e50b","resolution":{"observed_at":"2026-08-06T13:07:28.441776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-06T13:07:28.446461Z","title":"Unterthiner, S","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.446461Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:d5742e54b5fc221afd767f77c47d2deb35c2b10a9b738f895a4835eca3a85bb6","observation_id":"911f72e8-e992-464b-a06f-98a3a7828c36","resolution":{"observed_at":"2026-08-06T13:07:28.446461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-06T13:07:28.451541Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.451541Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:fd194290b1d82a4cb0663ac4bea8d006be53bcc242a0ff7d6ac0a271d620fa34","observation_id":"b96490e4-aa69-40c6-bacf-c7c7a17f4b8f","resolution":{"observed_at":"2026-08-06T13:07:28.451541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:29.226782Z","title":null,"venue":null,"work_id":"222b7c27-a398-42fa-bd3d-3181fca6f18d","year":2024},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.455985Z"},"links":{"citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:61ce35abdf7bec7ebc358c91e0e9563533dd3e47ffc544134a09cd43dae16f0f","observation_id":"f05d9c9e-8209-40d0-92dd-2439c2c20af3","resolution":{"observed_at":"2026-08-06T13:07:29.231260Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:29.210823Z","title":null,"venue":null,"work_id":"9f50b7ce-4ec7-4197-928e-2c1951121898","year":2004},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.460499Z"},"links":{"citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:d2a32f9bf9d901eebec039404d1e88c50de8261ec54b047296f93ecbc98a8370","observation_id":"5f57e324-f84c-4947-9944-0fa4a996ba26","resolution":{"observed_at":"2026-08-06T13:07:29.215323Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-06T13:07:28.465203Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.465203Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:90b05251698b899b6023075977fead01688807b45d5731d13bcd45d291668787","observation_id":"e2a42bc8-8de1-48c5-86fa-931fa8aea62a","resolution":{"observed_at":"2026-08-06T13:07:28.465203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-06T13:07:28.470675Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.470675Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:ec2a5717c8a075fee1a50b86059a7c664189fd3d3472a9ecbb5b8aabe7772be9","observation_id":"58d16370-0f4a-40c3-99fb-33a481335cdd","resolution":{"observed_at":"2026-08-06T13:07:28.470675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04145","last_updated":"2023-11-07T17:16:06Z","snapshot_observed_at":"2026-08-02T12:25:34.488259Z","submitted_at":"2023-11-07T17:16:06Z","title":"I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04145","snapshot_observed_at":"2026-08-06T13:07:28.475660Z","title":"Zhang, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.475660Z"},"links":{"cited_paper":"/paper/2311.04145","citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:c9a61891d02ccb71173e01f28475c6601c4d3594862a63f9f03fe7db6f17d78a","observation_id":"f0e7c99b-5778-404a-9df4-1a142fa9dfc4","resolution":{"observed_at":"2026-08-06T13:07:28.475660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-07-06T20:32:05.164336Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03897","snapshot_observed_at":"2026-08-06T13:07:28.480478Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.480478Z"},"links":{"cited_paper":"/paper/2502.03897","citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:103ca7907695332fb489930549ffbd531cc92cd9e3faf4b93b62ac80b87f0fcb","observation_id":"a65d3b03-373a-4102-baa0-0f2224156e3b","resolution":{"observed_at":"2026-08-06T13:07:28.480478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:29.193457Z","title":null,"venue":null,"work_id":"0bfb52d5-4156-45d6-86f0-382dc771bee7","year":2021},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.484954Z"},"links":{"citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:d6ef74f3debfd2ea90f169fd9bdab41c455e1ef13be78095261ff91ddd203098","observation_id":"6d3e204d-6399-4076-b7db-fb482bc4b46a","resolution":{"observed_at":"2026-08-06T13:07:29.199169Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:29.377210Z","title":null,"venue":null,"work_id":"94b6b421-aa6b-4d75-aa7b-a989488236bf","year":2025},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.351198Z"},"links":{"citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:2d8feabeea6bfd3b5182559e9703254deb6bc1ef0d4204559f54163ea2bcd6f5","observation_id":"49282654-e179-469a-b54b-936a4e4ae31d","resolution":{"observed_at":"2026-08-06T13:07:29.382684Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:07:29.344141Z","title":"org / abs / 2505","venue":null,"work_id":"b8c21703-84ad-480e-8bc1-c4d1d45064da","year":null},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.380312Z"},"links":{"citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:4cb7d7ec546eaaa1965486ac8f7d446c68a885119f15620a9bd2c1eb961cdef8","observation_id":"bbd571e3-6e76-491f-80dc-fdf992197bc7","resolution":{"observed_at":"2026-08-06T13:07:29.349083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T13:07:28.037443Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":33,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2507.20987."}