Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-07T04:49:09.335889Z
Paper Citation Record · LEDGER
As of 20 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 1 inbound Pith citation observation for arXiv:2506.09556.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-07T04:49:09.335889Z
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-20T06:33:59.587034+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links, observed 2026-08-07T04:49:06.392265Z
A source-named dated measurement, never combined with another source.
Source: pith, observed 2026-08-07T04:49:09.594801Z
37 of 37 outbound references displayed
External citation measurements
No source-named external measurement is stored.
Observation d16c6d11-83fe-4131-bab5-2ec70e60726d · outbound
MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions Categorical Emo- tion Recognition
Reference 1
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.
Observation 9badd1b9-a52a-469a-9d80-46af3ab08019 · outbound
MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions
Reference 2
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.
Observation 12d57c54-07d0-4e7d-ae7f-fe4e76ad3cb5 · outbound
MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions Overview The novelty of our approach stems from three key directions: 1) architecture, 2) data utilization and 3) training recipe
Reference 3
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.
Observation 0494fa24-9d83-4d75-81d0-814cf1cf5346 · outbound
MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions The Stage 3 meta-classifier uses batch size 128 and learning rate 1e-3 without M.MixUp
Reference 4
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.
Observation dd6468ea-74ef-4c5e-8316-e55064c069c6 · outbound
MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions Unresolved cited work
Reference 5
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.
Observation 6a057bc7-41f9-428b-939f-0407ed8b9e8c · outbound
MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions Unresolved cited work
Reference 6
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.
Observation 69592d8d-9fb1-4522-9740-adcab9a7dd85 · outbound
MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions Unresolved cited work
Reference 7
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.
Observation 0dad5a84-0db1-4a82-a23b-e883d17b77a9 · outbound
MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions Emotion recognition in human- computer interaction,
Reference 8
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.
Observation 36caba0a-ec5c-464b-a2d8-a4072a2a11fc · outbound
MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions Make patient consultation warmer: A clinical application for speech emotion recognition,
Reference 9
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.
Observation ddd14370-4c88-4304-98eb-0643ee3f4472 · outbound
MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions Integration of driver be- havior into emotion recognition systems: A preliminary study on steering wheel and vehicle acceleration,
Reference 10
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.
Observation e944c8ae-e12a-4a23-bc6b-7b3964a3cdb8 · outbound
MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions Call redistribution for a call center based on speech emotion recognition,
Reference 11
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.
Observation 26a9d0b5-8444-4c67-9620-331f874df050 · outbound
MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions emotion2vec: Self-supervised pre-training for speech emotion representation,
Reference 12
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.
Observation 1e4348d4-2ca5-4039-aea8-8ffe4ab2c932 · outbound
MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions Adieu features? end-to-end speech emotion recognition using a deep convolutional recurrent network,
Reference 13
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.
Observation d1dd1b22-bb67-460b-9f0f-844433cf70d7 · outbound
MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions The interspeech 2025 challenge on speech emotion recognition in naturalistic conditions,
Reference 14
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.
Observation 3e8f70a8-a254-4928-86a2-3f8df4e160f9 · outbound
MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions Building naturalistic emotionally bal- anced speech corpus by retrieving emotional speech from existing podcast recordings,
Reference 15
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.
Observation 462c9e3d-d649-46fd-bb64-ddcb91d79659 · outbound
MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time,
Reference 16
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.
Observation 0a85acd4-f961-4969-a404-5ef36734388f · outbound
MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions Deep hier- archical fusion with application in sentiment analysis,
Reference 17
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.
Observation c1d370ad-ad16-49ac-9a81-8fccc442f7cd · outbound
MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions Iemocap: Interactive emotional dyadic motion capture database,
Reference 18
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.
Observation 8a41fd6d-e4bf-403f-970d-53cc5e70328f · outbound
MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions Multimodal language analysis in the wild: Cmu-mosei dataset and interpretable dynamic fusion graph,
Reference 19
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.
Observation 70fe6991-914a-48e8-9c93-61251e71b6df · outbound
MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions A survey of speech emotion recognition in natural environment,
Reference 20
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.
Observation b60dca6a-993c-4f54-b86f-e1dc96de0065 · outbound
MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions WavLLM: Towards robust and adaptive speech large language model,
Reference 21
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.
Observation 4d577b80-37f9-45ed-aba9-e89ed2092976 · outbound
MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions Soft-target training with ambiguous emotional ut- terances for dnn-based speech emotion classification,
Reference 22
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.
Observation 815d5e63-b387-41a7-b82a-e473abebfc6b · outbound
MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions Manifold mixup: Better represen- tations by interpolating hidden states,
Reference 23
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.
Observation b4770892-23f7-424b-aa38-1c9c8141cd32 · outbound
MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions Powmix: A versa- tile regularizer for multimodal sentiment analysis,
Reference 24
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.
Observation 4d07d30a-53a2-4414-b0d1-c55a0835069b · outbound
MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions Speech emotion recognition with multi-task learning,
Reference 25
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.
Observation a0b28d41-bf57-4949-aeb7-86e82cddf8fe · outbound
MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions 1st Place Solution to Odyssey Emotion Recognition Challenge Task1: Tackling Class Imbalance Problem
Reference 26
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.
Observation 07c27be4-6c06-4774-b74d-2b0d0210aacd · outbound
MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions Meta-classifiers easily im- prove commercial sentiment detection tools,
Reference 27
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.
Observation d4f1aed8-ee61-4753-9e18-001f4ba3cb8e · outbound
MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions Attention is all you need,
Reference 28
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.
Observation 719d48d6-3b68-4008-9942-34204805d496 · outbound
MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions Wavlm: Large-scale self-supervised pre-training for full stack speech processing,
Reference 29
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.
Observation d896ca3b-cecd-4987-a3a0-3f472e2848c9 · outbound
MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,
Reference 30
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b7a0a019-5306-4013-80b2-77b90dbf5bfe · outbound
MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions Robust speech recognition via large-scale weak su- pervision,
Reference 31
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9d6105cb-5681-4626-9ecb-d3e791be2d64 · outbound
MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions Roberta: A robustly optimized bert pretraining approach,
Reference 32
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f6fa6fb4-aab2-4edd-b0c2-793f97481112 · outbound
MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions Smarter, better, faster, longer: A modern bidirectional encoder for fast, memory efficient, and long context finetuning and inference,
Reference 33
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.
Observation cf9926c2-6b78-4f5a-8195-5296dfea9d97 · outbound
MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions Long short-term memory,
Reference 34
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 344cae71-43c8-46cd-8ee7-93313d28eced · outbound
MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions Vicinal risk minimization,
Reference 35
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.
Observation 8add645e-4b2c-443b-b366-0b70293a58ce · outbound
MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions Decoupled weight decay regulariza- tion,
Reference 36
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.
Observation b42fd3f9-8335-4f7a-8ef7-22e8bcfa5736 · outbound
MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions Py- torch: An imperative style, high-performance deep learning li- brary,
Reference 37
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.
Observation 9badd1b9-a52a-469a-9d80-46af3ab08019 · inbound
MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions
Reference 2
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.