Introduces the BAH dataset with 1,427 annotated videos for multimodal recognition of ambivalence/hesitancy in digital behavior change contexts.
2408.15777 , archiveprefix =
6 Pith papers cite this work. Polarity classification is still indexing.
representative citing papers
ARGen uses AU-guided prompts and a reinforcement-learned diffusion strategy to synthesize scarce-class facial expression videos that improve dynamic emotion recognition.
DuSE is a new dual-stream model for dynamic facial expression recognition that explicitly models cognitive priming and conceptual knowledge integration to reach state-of-the-art accuracy on in-the-wild benchmarks.
Standard deep multimodal models and LLM zero-shot inference achieve only limited performance on video ambivalence/hesitancy recognition for digital health personalization.
This survey organizes deep learning FER literature into five evolutionary phases and a seven-criteria taxonomy, compares datasets and performance, and outlines challenges.
A user study with 20 participants found that linguistic analysis is more reliable than facial recognition for detecting emotions in proactive AI agents due to users displaying neutral 'poker faces,' while also showing that such agents can elicit emotions but risk disengagement if proactivity is unca
citing papers explorer
-
BAH Dataset for Ambivalence/Hesitancy Recognition in Videos for Digital Behavioural Change
Introduces the BAH dataset with 1,427 annotated videos for multimodal recognition of ambivalence/hesitancy in digital behavior change contexts.
-
ARGen: Affect-Reinforced Generative Augmentation towards Vision-based Dynamic Emotion Perception
ARGen uses AU-guided prompts and a reinforcement-learned diffusion strategy to synthesize scarce-class facial expression videos that improve dynamic emotion recognition.
-
Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling
DuSE is a new dual-stream model for dynamic facial expression recognition that explicitly models cognitive priming and conceptual knowledge integration to reach state-of-the-art accuracy on in-the-wild benchmarks.
-
Multimodal Ambivalence/Hesitancy Recognition in Videos for Personalized Digital Health Interventions
Standard deep multimodal models and LLM zero-shot inference achieve only limited performance on video ambivalence/hesitancy recognition for digital health personalization.
-
Facial Expression Recognition in the Deep Learning Era: A Systematic Multi-Criteria Review of Methods, Models, Datasets, Performance, Challenges, and Future Research Directions
This survey organizes deep learning FER literature into five evolutionary phases and a seven-criteria taxonomy, compares datasets and performance, and outlines challenges.
-
Evaluating multimodal emotion recognition in proactive conversational agents: A user study
A user study with 20 participants found that linguistic analysis is more reliable than facial recognition for detecting emotions in proactive AI agents due to users displaying neutral 'poker faces,' while also showing that such agents can elicit emotions but risk disengagement if proactivity is unca