Pith. sign in

Paper Citation Record · LEDGER

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1

As of 7 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2507.20987.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.20987 v2

Coverage vector

measured 46 of 46 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T13:07:28.484954Z

measured 46 of 46 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

46 of 46 outbound references displayed

  • verified exact0
  • verified fuzzy12
  • unresolved33
  • parse uncertain1
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 9f8eb8eb-c408-4fb3-bb91-927714cba40b · outbound

This paper cites Better speech synthesis through scaling.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Better speech synthesis through scaling

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.255179Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.255179Z digest=sha256:c0c1e797f27a2c087c4c3c33d09b6f8df1f387d0b9130cb406c15d4a251e7e3c

Observation cd26a3e6-2448-4370-a2b4-b2a57e88ba75 · outbound

This paper cites Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.260898Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.260898Z digest=sha256:ac084f269ce80cb7dfbe0ddb8a136369af412076b13a976a11d8d880e44b9c1b

Observation aec1f845-f6cc-4662-82f3-f749f6d011ae · outbound

This paper cites Caron, H.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Caron, H

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:07:29.518833Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:07:28.266713Z digest=sha256:8ad2890180a7a1b98dd25228be2e9fdf8a5d1070dca668907724cf24c3ffa5a7

Observation 9ba859d9-ee81-4060-baff-24242d4ea042 · outbound

This paper cites Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.271561Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.271561Z digest=sha256:ff6a9caba9e96471f795e4e158c39b72d87ef63aa6921c70605fab9ddc54fb3c

Observation 46495ded-d986-48ff-b43c-3b6fce0f7863 · outbound

This paper cites Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Video Diffusion Transformer.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Video Diffusion Transformer

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.276988Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.276988Z digest=sha256:1f39488e78dd6ca8911bc044afc1d16eb0df3537a68ca712c8e2b23da62e7d14

Observation dc3a77a5-34c6-4bfa-8977-54a8de14198f · outbound

This paper cites DeepMind.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 DeepMind

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:07:29.501595Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:07:28.282867Z digest=sha256:cb8ea1c06b3cc397f79da9a722a92d2c34a22b2daff3e72638253e5d13c85f49

Observation 90e4fa50-9a9a-4a34-b8f1-b5d945e5cd43 · outbound

This paper cites Eleven Multilingual v2: A foundational multi- lingual text-to-speech model supporting 29 languages.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Eleven Multilingual v2: A foundational multi- lingual text-to-speech model supporting 29 languages

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:07:29.483611Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:07:28.288087Z digest=sha256:90f4404a6d47d13d952d2aaaac8661a780a98928922c3760d5bbcd1c5c359300

Observation 0d58c0c6-b868-4e86-a62e-335215e975b1 · outbound

This paper cites an unresolved cited work.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Unresolved cited work

Reference 8

Resolution
unresolved
raw_fallback, observed 2026-08-06T13:07:29.464930Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:07:28.293808Z digest=sha256:f169ef9532d525e108a7c93d4ae61c6c02fe5027133e6bad6643a8cff02f487f

Observation 8e0641f0-7e13-4a3d-92ce-7959a053128d · outbound

This paper cites an unresolved cited work.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Unresolved cited work

Reference 9

Resolution
unresolved
raw_fallback, observed 2026-08-06T13:07:29.447808Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:07:28.298680Z digest=sha256:e9a43bfe68e5570480dbe0d7bb34802d5589282eb4aa2e9b392cbe929e91020c

Observation bb966614-8d46-43d4-8541-a0b8d25470cc · outbound

This paper cites MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.303813Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.303813Z digest=sha256:f2cd1ffad866bdcfa090da52177fb759a4e24cfbe7bab0c6bb5208fb374519c9

Observation 5b8e0228-cbc8-4122-ac5a-358bf6dfcf9c · outbound

This paper cites Step-Video-TI2V Technical Report: A State-of-the-Art Text-Driven Image-to-Video Generation Model.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Step-Video-TI2V Technical Report: A State-of-the-Art Text-Driven Image-to-Video Generation Model

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.308903Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.308903Z digest=sha256:2fbaaf93566e86fa421f7709c671467b9904e8cd25400868fcc3e48c40473ee4

Observation c62460bc-87fe-4d26-96fc-13a071ce6405 · outbound

This paper cites Huynh-Thu and M.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Huynh-Thu and M

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:07:29.430380Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:07:28.314402Z digest=sha256:7b19a98630edb1dc5357840f2c12a69d3ba626b38d68303a2a480059767d64cd

Observation d7897926-fa51-4621-b3e6-b33f79123df8 · outbound

This paper cites Sonic: Shifting Focus to Global Audio Perception in Portrait Animation.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Sonic: Shifting Focus to Global Audio Perception in Portrait Animation

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.320448Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.320448Z digest=sha256:680cd6aa1bcf103312a7a282f8a1861d3ae32fcc18a346a2ddfaddf02ff8f8a5

Observation 466c15f3-68e5-430a-a523-6f0b68f7208f · outbound

This paper cites Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.328153Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.328153Z digest=sha256:2d9f3786520f31d3b627015185a2f2309826473e763d59ea66fc025bdbba156d

Observation 21564f20-7b37-41e5-a88a-01c967b8ac72 · outbound

This paper cites an unresolved cited work.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Unresolved cited work

Reference 15

Resolution
unresolved
raw_fallback, observed 2026-08-06T13:07:29.413034Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:07:28.336008Z digest=sha256:9cbb079f5c52e4bc846d3426dbda1919c9a7cfc5d8a9b7f2fe460a55f1f0bc48

Observation 9aad734f-4aa9-49d6-b058-f8c508a0b8d1 · outbound

This paper cites HunyuanVideo: A Systematic Framework For Large Video Generative Models.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 HunyuanVideo: A Systematic Framework For Large Video Generative Models

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.341053Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.341053Z digest=sha256:b1d742ef30d83b01081b013147024767240d1af908710624adf095db0d82eddf

Observation 1a359396-9b3a-4e95-887c-2bf2ba39097f · outbound

This paper cites Laion aesthetic predictor.https : / / github.com/LAION-AI/aesthetic-predictor,.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Laion aesthetic predictor.https : / / github.com/LAION-AI/aesthetic-predictor,

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.346244Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.346244Z digest=sha256:20559145f20f906335d3131184fdf495b32f43988f5aa9d86f87d4432f27576d

Observation 00912a17-7a4f-48c1-b26c-328ee3e8e517 · outbound

This paper cites LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.356402Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.356402Z digest=sha256:e6b563fa9c2d3025b46fe1087f18b1b1cbe1ed5ec5aa57b7c27616bf9bb23af6

Observation c6c8752d-af4f-44c6-848d-8be9cc31a660 · outbound

This paper cites VideoGen: A Reference-Guided Latent Diffusion Approach for High Definition Text-to-Video Generation.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 VideoGen: A Reference-Guided Latent Diffusion Approach for High Definition Text-to-Video Generation

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.361100Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.361100Z digest=sha256:f087d7f73f2f6f7257fc9f145af03fcee6f332fe737e2078577fc853db69d094

Observation 6d7bc63b-cc26-415a-8776-22e95544bb13 · outbound

This paper cites Li, Z.-L.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Li, Z.-L

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:07:29.365371Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:07:28.366070Z digest=sha256:1de6ed1e6d9c72fc4bdb35296fb3cb89cf3da09c11c6a6b10139e9c1de473719

Observation 5071510a-7b7c-4f9b-ae7e-6bffc5a1d227 · outbound

This paper cites an unresolved cited work.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Unresolved cited work

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.370814Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.370814Z digest=sha256:1bf02019d03ff78ed2c0bce99e0f35770b33ff6a18e3d5f8b064f565e8d8ef95

Observation 493cbbe6-407d-4264-9cb9-17e1b0a7a46d · outbound

This paper cites EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.375424Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.375424Z digest=sha256:1099b9275660e15263b11b2d135571a4b9e4c7191a392e118d1f845074fa16e2

Observation 249acc42-76b7-431f-9846-9f602c448da1 · outbound

This paper cites an unresolved cited work.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Unresolved cited work

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.384776Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.384776Z digest=sha256:2f5a67b0687903685c5e041df44cc3e62e4c33c89ae00b5aabca5fd1c7e43ac2

Observation d65ff508-4c87-4cf0-bbb2-a3828f0ab2e5 · outbound

This paper cites StyleTalker: One-shot Style-based Audio-driven Talking Head Video Generation.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 StyleTalker: One-shot Style-based Audio-driven Talking Head Video Generation

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.389538Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.389538Z digest=sha256:3a19d021004479948b5f5d04e558a5cf744a6569df9cc5d1e1897aa4f1753977

Observation 4b24eed8-d9d4-4bcd-9af6-f624f2a4b329 · outbound

This paper cites GPT-4o-Mini- Audio-Preview: A compact, cost-efficient audio-capable 5 multimodal model.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 GPT-4o-Mini- Audio-Preview: A compact, cost-efficient audio-capable 5 multimodal model

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:07:29.332694Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:07:28.394030Z digest=sha256:61616103af6672c5f215e80b360a6b08dfcb8fe82cf1dabb5ac145e2bef9b9ff

Observation c36f0941-a34f-487b-9951-f4a20911b540 · outbound

This paper cites Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.398657Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.398657Z digest=sha256:c94a15ae74ea1e77952dd393fe0622cc60b29d789276915da286cf66f0c3c6c2

Observation 5625fff3-0bf1-40cd-92e9-1fc6ebba0e6f · outbound

This paper cites Prajwal, R.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Prajwal, R

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:07:29.316252Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:07:28.403719Z digest=sha256:2d28759b62c9fe028f1eeae2fa955aa6063cdd2d6ab81ab41598a1a6a4102854

Observation 08efa263-aea2-490e-922e-01498341bd55 · outbound

This paper cites Versatile Multimodal Controls for Expressive Talking Human Animation.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Versatile Multimodal Controls for Expressive Talking Human Animation

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.408107Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.408107Z digest=sha256:9e88959fac4d64bf4a18bdd27a64bc64c1ae1e3bdedec6598755786cfca095f2

Observation 012c4635-443b-4b3d-a756-32c02e46e51c · outbound

This paper cites SkyReels-A1: Expressive Portrait Animation in Video Diffusion Transformers.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 SkyReels-A1: Expressive Portrait Animation in Video Diffusion Transformers

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.413224Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.413224Z digest=sha256:ad49847d0289b64d2c77396d959381e4b425fc3f2953df8dbdb5791d1347440c

Observation 5c9c5499-7162-41be-8e14-9bfc4b43b05a · outbound

This paper cites Radford, J.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Radford, J

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:07:29.299281Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:07:28.418061Z digest=sha256:e1c646803a509e4e08ca08f9a22a72e0336b44f32f5de24997d780454dd201da

Observation 1d1b5d94-8103-4b62-a707-d8b6ac5e2323 · outbound

This paper cites Make-A-Video: Text-to-Video Generation without Text-Video Data.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Make-A-Video: Text-to-Video Generation without Text-Video Data

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.422653Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.422653Z digest=sha256:46c416d59dd1c8c5ee7423545f47151a77e768a1e2ff681e547d4efa69ebb96d

Observation f891e8f8-1f30-426a-85e8-3b82099ddc4f · outbound

This paper cites Bark: Text-prompted generative audio model.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Bark: Text-prompted generative audio model

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:07:29.281309Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:07:28.427315Z digest=sha256:d0a3c768c67c1f9cb8bf5e86e7953bc195abcb5d5ee55e8c8b633e92dd5a3f4b

Observation fafa85cc-e0c0-4ce5-850c-464e45134edd · outbound

This paper cites Teed and J.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Teed and J

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:07:29.263605Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:07:28.431928Z digest=sha256:0e36bc0a0a2dedc14a7ec886c29eded554b5d3a4c003252a1c9b14aeb524a53f

Observation 4494dd48-0f1b-4b3c-bb72-5b9b09201c56 · outbound

This paper cites Google introduces stable gemini 2.5 flash and pro, previews gemini 2.5 flash-lite.The Economic Times (India).

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Google introduces stable gemini 2.5 flash and pro, previews gemini 2.5 flash-lite.The Economic Times (India)

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:07:29.247728Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:07:28.436864Z digest=sha256:f554959949eb9f613d695e4afc4a738beae1ceac8df513098765c784ae03bbb6

Observation 17262ae0-cc5e-4735-ba82-327d2cc7e50b · outbound

This paper cites StableAnimator: High-Quality Identity-Preserving Human Image Animation.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 StableAnimator: High-Quality Identity-Preserving Human Image Animation

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.441776Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.441776Z digest=sha256:b66759829528163775a182d9b904e6fa84f73fed6d930bfe1acbc0e5cb3f20b0

Observation 911f72e8-e992-464b-a06f-98a3a7828c36 · outbound

This paper cites Towards Accurate Generative Models of Video: A New Metric & Challenges.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Towards Accurate Generative Models of Video: A New Metric & Challenges

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.446461Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.446461Z digest=sha256:d5742e54b5fc221afd767f77c47d2deb35c2b10a9b738f895a4835eca3a85bb6

Observation b96490e4-aa69-40c6-bacf-c7c7a17f4b8f · outbound

This paper cites Wan: Open and Advanced Large-Scale Video Generative Models.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Wan: Open and Advanced Large-Scale Video Generative Models

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.451541Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.451541Z digest=sha256:fd194290b1d82a4cb0663ac4bea8d006be53bcc242a0ff7d6ac0a271d620fa34

Observation f05d9c9e-8209-40d0-92dd-2439c2c20af3 · outbound

This paper cites an unresolved cited work.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Unresolved cited work

Reference 38

Resolution
unresolved
raw_fallback, observed 2026-08-06T13:07:29.231260Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:07:28.455985Z digest=sha256:61ce35abdf7bec7ebc358c91e0e9563533dd3e47ffc544134a09cd43dae16f0f

Observation 5f57e324-f84c-4947-9944-0fa4a996ba26 · outbound

This paper cites an unresolved cited work.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Unresolved cited work

Reference 39

Resolution
unresolved
raw_fallback, observed 2026-08-06T13:07:29.215323Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:07:28.460499Z digest=sha256:d2a32f9bf9d901eebec039404d1e88c50de8261ec54b047296f93ecbc98a8370

Observation e2a42bc8-8de1-48c5-86fa-931fa8aea62a · outbound

This paper cites Qwen2.5-Omni Technical Report.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Qwen2.5-Omni Technical Report

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.465203Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.465203Z digest=sha256:90b05251698b899b6023075977fead01688807b45d5731d13bcd45d291668787

Observation 58d16370-0f4a-40c3-99fb-33a481335cdd · outbound

This paper cites CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.470675Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.470675Z digest=sha256:ec2a5717c8a075fee1a50b86059a7c664189fd3d3472a9ecbb5b8aabe7772be9

Observation f0e7c99b-5778-404a-9df4-1a142fa9dfc4 · outbound

This paper cites I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.475660Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.475660Z digest=sha256:c9a61891d02ccb71173e01f28475c6601c4d3594862a63f9f03fe7db6f17d78a

Observation a65d3b03-373a-4102-baa0-0f2224156e3b · outbound

This paper cites UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.480478Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.480478Z digest=sha256:103ca7907695332fb489930549ffbd531cc92cd9e3faf4b93b62ac80b87f0fcb

Observation 6d3e204d-6399-4076-b7db-fb482bc4b46a · outbound

This paper cites an unresolved cited work.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Unresolved cited work

Reference 44

Resolution
unresolved
raw_fallback, observed 2026-08-06T13:07:29.199169Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:07:28.484954Z digest=sha256:d6ef74f3debfd2ea90f169fd9bdab41c455e1ef13be78095261ff91ddd203098

Observation 49282654-e179-469a-b54b-936a4e4ae31d · outbound

This paper cites an unresolved cited work.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Unresolved cited work

Reference 2022

Resolution
parse uncertain
raw_fallback, observed 2026-08-06T13:07:29.382684Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:07:28.351198Z digest=sha256:2d8feabeea6bfd3b5182559e9703254deb6bc1ef0d4204559f54163ea2bcd6f5

Observation bbd571e3-6e76-491f-80dc-fdf992197bc7 · outbound

This paper cites org / abs / 2505.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 org / abs / 2505

Reference 2025

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:07:29.349083Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:07:28.380312Z digest=sha256:4cb7d7ec546eaaa1965486ac8f7d446c68a885119f15620a9bd2c1eb961cdef8

Pith citing papers

No inbound Pith citation observations are available.