Pith. sign in

← back to paper

Review history

arxiv: 2506.16716 · 2 revisions

V-CASS: Vision-context-aware Expressive Speech Synthesis for Enhancing User Understanding of Videos

  1. 2026-08-15 CONDITIONAL MODERATE v1.4.0-alltime-deepseek-medium novelty 5.0
    106256 ms 11307 in 11390 out 2026-08-15T19:19:34.418252+00:00
  2. 2026-08-06 CONDITIONAL MODERATE v1.4.0-alltime-deepseek-medium novelty 4.0
    122736 ms 11309 in 11091 out 2026-08-06T23:36:52.474046+00:00