{"as_of":"2026-08-08T17:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7b241acd0362c8fe6acc2332ee67c83d24fe5662841457241c4bcabee1f512fc","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T18:16:37.329172Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T18:16:33.923867Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.18336","snapshot_observed_at":"2026-08-01T18:16:33.923867Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:33.923867Z"},"links":{"cited_paper":"/paper/2607.18336","citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:32cb4b3984a41818d9cc51f47204f30332e539dfe4d098505f0e5f32465487ab","observation_id":"9263e159-9172-44d2-9bda-1acf3735a246","resolution":{"observed_at":"2026-08-01T18:16:33.923867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.18336/citation-record","integrity":"/paper/2607.18336/integrity","json":"/paper/2607.18336/citation-record.json","paper":"/paper/2607.18336"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:16:33.830518Z","title":"MERC analyzes dialogue turns from multiple modalities (e.g., text, au- dio, and visual) and assigns one emotion label per utterance [1, 2]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:33.830518Z"},"links":{"citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:98911121da0dc07fcf6784cac1de58f4af503ca04118a9e43bbd272dbb740f16","observation_id":"76d64b1f-94a7-4a71-a88b-77df92e4a5ed","resolution":{"observed_at":"2026-08-01T18:16:33.830518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.18336","snapshot_observed_at":"2026-08-01T18:16:33.923867Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:33.923867Z"},"links":{"cited_paper":"/paper/2607.18336","citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:32cb4b3984a41818d9cc51f47204f30332e539dfe4d098505f0e5f32465487ab","observation_id":"9263e159-9172-44d2-9bda-1acf3735a246","resolution":{"observed_at":"2026-08-01T18:16:33.923867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:16:34.022610Z","title":"Leave-One-Session-Out","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:34.022610Z"},"links":{"citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:a605da7ad4d42a9e7ad5bf85732884ed1e312aa4fcf7506f357a1034027ea28b","observation_id":"78af582f-8cc2-4472-88bd-6481b20d647f","resolution":{"observed_at":"2026-08-01T18:16:34.022610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:16:34.130535Z","title":"Concat” directly concatenates features (R δ) from dif- ferent modalities and feeds them to the classifier. “Attention","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:34.130535Z"},"links":{"citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:e40955b1028c3e5904a6bdae869d466b4f42260281de29aff3f77c082fcddcd5","observation_id":"efccd31a-d060-44c6-8d3b-fc221bbde8c2","resolution":{"observed_at":"2026-08-01T18:16:34.130535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:16:34.199150Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:34.199150Z"},"links":{"citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:841c782e00ac06b016c8559a9ef97b94ada6be36b3fb2c9a507a1f311735ce5f","observation_id":"65d058e0-c252-45e2-8597-aa282b6be586","resolution":{"observed_at":"2026-08-01T18:16:34.199150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:16:34.266541Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:34.266541Z"},"links":{"citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:befe6d97c185fdb6ed7d59f4c37fb11e6723b0e09fe637c05d66eb72b0c95a8a","observation_id":"56aa1b3f-09f4-422c-b891-08298e0c8443","resolution":{"observed_at":"2026-08-01T18:16:34.266541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:16:34.391106Z","title":"All scientific content, experiments and analyses were produced and verified by the authors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:34.391106Z"},"links":{"citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:3c6ca4a321cba7e1a1ef8fd00269c2dfd12057e370091122e36a512c18e3e739","observation_id":"e8730d56-a163-4d0d-91f2-236e7f4914d5","resolution":{"observed_at":"2026-08-01T18:16:34.391106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:16:34.461617Z","title":"Emotion recognition in conversation: Research challenges, datasets, and recent advances,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:34.461617Z"},"links":{"citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:c4c56a01e2ba0a8b6dc8875c265103688428121b2905f5649b68dfad6db547a0","observation_id":"a8c32d62-b5ee-45e8-9bd2-3e32c4dd9b28","resolution":{"observed_at":"2026-08-01T18:16:34.461617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:16:34.547562Z","title":"MM-NodeFormer: Node transformer multimodal fusion for emotion recognition in conver- sation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:34.547562Z"},"links":{"citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:dbe7a05c4ff5387e7f2b11953a1e6bc7e4dd1a1d8bbf3558d7dd232ba1ad49db","observation_id":"2e2957a1-6c91-41f3-b7eb-7c9a1e961de9","resolution":{"observed_at":"2026-08-01T18:16:34.547562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:16:34.612785Z","title":"Multiple classifier systems for the classification of audio-visual emotional states,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:34.612785Z"},"links":{"citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:8f27db45a31d223fff7b9128006a633bb04fc63be6f32bcf03b3a01afd166867","observation_id":"9ac2a3c3-dc0b-44f3-8a7f-f1c6957635b2","resolution":{"observed_at":"2026-08-01T18:16:34.612785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:16:34.681203Z","title":"MultiEMO: An attention-based correlation-aware multimodal fusion framework for emotion recognition in conversations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:34.681203Z"},"links":{"citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:df9595e0b3759bf532bbbf838da754ba43d9dd0e32d98b14ad4ce9c5f3969a65","observation_id":"5a646091-c073-4ec2-af78-ed3514fffbf0","resolution":{"observed_at":"2026-08-01T18:16:34.681203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:16:34.766958Z","title":"BA V-MossFormer2: En- hanced MossFormer2 for binaural audio-visual speech enhance- ment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:34.766958Z"},"links":{"citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:5923b8253d979dc8e0cb64fe6fd543df3175ec0f980fe0659065cdeea1d5fa42","observation_id":"8e7acc78-2168-451e-b613-d03356de7d3f","resolution":{"observed_at":"2026-08-01T18:16:34.766958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:16:34.848128Z","title":"M2FNET: Multi-modal fusion network for emotion recognition in conversation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:34.848128Z"},"links":{"citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:ef830a8b7609f499b4b40b3a3f5a0269792d23f6cf649ca0f736ebf403428716","observation_id":"ce87c3ad-2505-46e5-9b2c-768df9344030","resolution":{"observed_at":"2026-08-01T18:16:34.848128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15432","last_updated":"2024-04-13T01:05:05Z","snapshot_observed_at":"2026-08-07T09:16:33.171687Z","submitted_at":"2023-07-28T09:29:42Z","title":"CFN-ESA: A Cross-Modal Fusion Network with Emotion-Shift Awareness for Dialogue Emotion Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15432","snapshot_observed_at":"2026-08-01T18:16:34.944281Z","title":"CFN-ESA: A cross-modal fusion network with emotion-shift awareness for dialogue emo- tion recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:34.944281Z"},"links":{"cited_paper":"/paper/2307.15432","citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:41f910797501e3ad0fea515e91e291ddf868a8243bc1a53c89cce0e8ca08ca2b","observation_id":"030260e6-4f96-42b2-a7db-d076dddeaeca","resolution":{"observed_at":"2026-08-01T18:16:34.944281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:16:35.026975Z","title":"IDIR: Identifying and Distilling Informative Relations for Speaker Verification,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:35.026975Z"},"links":{"citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:41cb3a84d49bc5954165ca4a0fb220ef8286fb30d32dab72bdda1f762c0de047","observation_id":"7bf942aa-f434-4e56-ae50-15da785288f7","resolution":{"observed_at":"2026-08-01T18:16:35.026975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:16:35.126423Z","title":"Unimodal-driven distillation in multimodal emotion recognition with dynamic fusion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:35.126423Z"},"links":{"citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:ab5922670166a0f579ac87bfb3b8b8d76eed07ef02c5155693b0d9a01fda7899","observation_id":"f3aca7c6-a5a2-4422-8897-2d9a16bce78e","resolution":{"observed_at":"2026-08-01T18:16:35.126423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:16:35.221123Z","title":"Distilling attention knowledge for speaker verification,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:35.221123Z"},"links":{"citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:ef4dc45ec7b3cffabb322391c0fd43a0a139ef1b8f7820119a88e2231a6c17b6","observation_id":"025be9b7-76d4-4d91-b208-90965ce76152","resolution":{"observed_at":"2026-08-01T18:16:35.221123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.25624","last_updated":"2026-04-28T13:30:17Z","snapshot_observed_at":"2026-08-07T04:40:15.889438Z","submitted_at":"2026-04-28T13:30:17Z","title":"UNet-Based Fusion and Exponential Moving Average Adaptation for Noise-Robust Speaker Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.25624","snapshot_observed_at":"2026-08-01T18:16:35.308561Z","title":"UNet-based fusion and exponential moving average adaptation for noise-robust speaker recognition,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:35.308561Z"},"links":{"cited_paper":"/paper/2604.25624","citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:0c2a824c4c0f0e2a6cc8095b44b13620752751c412988e34a407eeaf1dcff716","observation_id":"07c26ebd-a898-475a-9db5-30a24317e873","resolution":{"observed_at":"2026-08-01T18:16:35.308561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:16:35.425628Z","title":"De- noising student features with diffusion models for knowledge dis- tillation in speaker verification,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:35.425628Z"},"links":{"citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:e6e4ba52df64dd422e2c00c8ecce766ed1dd5daecede99d5dce2044d4b3fadda","observation_id":"925cb330-da57-4ae3-bbb8-4b643619a2f2","resolution":{"observed_at":"2026-08-01T18:16:35.425628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:16:35.516200Z","title":"Survey on audiovisual emotion recognition: Databases, features, and data fusion strate- gies,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:35.516200Z"},"links":{"citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:b4e3ec8269225b4a5ec5cfbef5bd0b62c9e492207a8835ddce7529d9a8763a42","observation_id":"5ae2aca7-5baf-40c3-8e00-2859e405a120","resolution":{"observed_at":"2026-08-01T18:16:35.516200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:16:35.587549Z","title":"A transformer-based model with self-distillation for multimodal emotion recognition in conversations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:35.587549Z"},"links":{"citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:7a09404698076a270d92d09a82921719652c69a8294c8bd8bf55bbc70f9e6bd6","observation_id":"133bf9a1-bbdd-4587-9ce5-0cf35af35bd3","resolution":{"observed_at":"2026-08-01T18:16:35.587549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:16:35.676548Z","title":"Enhancing multimodal emotion recognition through multi- granularity cross-modal alignment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:35.676548Z"},"links":{"citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:a87f4bb062a9a9c06d41859022dccdc8bcd3a0fa0278e3d4a9a35099252f55d4","observation_id":"1ac1addc-178d-45c1-9c21-d136bc5ae91c","resolution":{"observed_at":"2026-08-01T18:16:35.676548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:16:35.777250Z","title":"Enhancing emotion recognition in incomplete data: A novel cross-modal alignment, reconstruction, and refinement framework,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:35.777250Z"},"links":{"citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:0069c9786d831e76ee2856278b40dc83b6bca7364ee0a7660947236d6e1decd3","observation_id":"a2d4c460-e02e-4eee-ae94-07655da24ca5","resolution":{"observed_at":"2026-08-01T18:16:35.777250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:16:35.860716Z","title":"Disentangling speech representations learning with latent dif- fusion for speaker verification,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:35.860716Z"},"links":{"citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:b11c9cf9bb2673b77c5ad2b8cf22b3496a1630d9319046cc55a6d430d67fd388","observation_id":"c2b5bfc2-6231-464d-bcf9-56c0ad1a72a6","resolution":{"observed_at":"2026-08-01T18:16:35.860716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:16:35.957921Z","title":"Probabilistic face embeddings,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:35.957921Z"},"links":{"citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:b815507a67ab47e6fe5feb2e0224ced6342220c8302d2f60ff7570a85d266cf9","observation_id":"9efa950f-6d27-4616-95c9-c2f0420a2118","resolution":{"observed_at":"2026-08-01T18:16:35.957921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:16:36.040851Z","title":"Data uncertainty learning in face recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:36.040851Z"},"links":{"citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:da4d9a69858fbdfe69368e81813a36d0ab601ae46cd0d4a7c46fcaa0f7c1d4c4","observation_id":"d2443c18-9393-4785-aa00-e31d590917a1","resolution":{"observed_at":"2026-08-01T18:16:36.040851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:16:36.123432Z","title":"Map: Multimodal uncertainty-aware vision-language pre-training model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:36.123432Z"},"links":{"citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:80380b326b1ea0335cc89a3d1eb0a523412584e030b2c7c43c443b4fd376b6c0","observation_id":"7ac5c746-5a1e-4a3d-b5c5-bc0b08c470ab","resolution":{"observed_at":"2026-08-01T18:16:36.123432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:16:36.222069Z","title":"Masked graph learning with recurrent alignment for multimodal emotion recognition in conversation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:36.222069Z"},"links":{"citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:f4b2628ce338027f06115a89a2740817189e969440cdc887d8d9beb7aa077a47","observation_id":"796d4d75-58a2-4b8e-851f-644dac5fe20e","resolution":{"observed_at":"2026-08-01T18:16:36.222069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:16:36.292284Z","title":"COLD Fusion: Calibrated and or- dinal latent distribution fusion for uncertainty-aware multimodal emotion recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:36.292284Z"},"links":{"citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:a84cf28197a380d42cc0bae9f127be8883b52b4c458fa032477ce0e39caff8b6","observation_id":"23d7529a-d755-40fb-8534-c45e2c276bb7","resolution":{"observed_at":"2026-08-01T18:16:36.292284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:16:36.358613Z","title":"IEMOCAP: Interactive emotional dyadic motion capture database,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:36.358613Z"},"links":{"citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:345c470178ddc95e57c5cd6a7addc46fddd9fa7a5aad769f0a76d1fd5d1b1520","observation_id":"6b597a45-26ae-42fd-82aa-0d534066d8c5","resolution":{"observed_at":"2026-08-01T18:16:36.358613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.02508","last_updated":"2019-06-04T12:33:49Z","snapshot_observed_at":"2026-07-06T07:06:12.726165Z","submitted_at":"2018-10-05T03:50:24Z","title":"MELD: A Multimodal Multi-Party Dataset for Emotion Recognition in Conversations","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.02508","snapshot_observed_at":"2026-08-01T18:16:36.454435Z","title":"MELD: A multimodal multi-party dataset for emotion recognition in conversations,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:36.454435Z"},"links":{"cited_paper":"/paper/1810.02508","citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:fa9dd42803fbeafec3a45897025b282b687caf24af0faf8726cdeb0ebafe0742","observation_id":"c46d8dc4-9ea7-4826-a273-816f7a411f02","resolution":{"observed_at":"2026-08-01T18:16:36.454435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:16:36.519070Z","title":"MM-DFN: Mul- timodal dynamic fusion network for emotion recognition in con- versations,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:36.519070Z"},"links":{"citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:a9d79683a48a98475e45056d5f6450de4a15b37c5d2c4b10f23a33c29a51cb7d","observation_id":"16d39ec5-9b77-453d-a34c-6443420612ef","resolution":{"observed_at":"2026-08-01T18:16:36.519070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-01T18:16:36.595954Z","title":"RoBERTa: A robustly optimized bert pretraining approach,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:36.595954Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:c3b616dcb8523ceead13fbe1f07b7ecef985b8fdcb5925cac6ba6dcfa3ef1c54","observation_id":"ce08bf89-372d-49bf-aed2-30263da754cc","resolution":{"observed_at":"2026-08-01T18:16:36.595954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:16:36.667303Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech repre- sentations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:36.667303Z"},"links":{"citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:b17a30b7696d5b39b15c18864959fe0a655b9de213dcf2d33e920866e7ba558b","observation_id":"8f18efd3-4148-44c9-aa46-e728bd6a5e9b","resolution":{"observed_at":"2026-08-01T18:16:36.667303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:16:36.741994Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:36.741994Z"},"links":{"citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:744add442c09189a8cd7ea2451dda88c2bb59d3623c59d6280d76fd18cfbec26","observation_id":"7e766222-fbbd-4d76-ac06-bee173a28c7b","resolution":{"observed_at":"2026-08-01T18:16:36.741994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:16:36.814446Z","title":"DialogueRNN: An attentive rnn for emotion de- tection in conversations,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:36.814446Z"},"links":{"citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:4968193d6d8b73beaea426a8cc72032049645d41de2e55d2f2788f84bcd31396","observation_id":"87f7bd51-fd90-4436-8c64-b697cd2d1e38","resolution":{"observed_at":"2026-08-01T18:16:36.814446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.11540","last_updated":"2019-08-30T05:44:24Z","snapshot_observed_at":"2026-08-06T12:48:13.189790Z","submitted_at":"2019-08-30T05:44:24Z","title":"DialogueGCN: A Graph Convolutional Neural Network for Emotion Recognition in Conversation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.11540","snapshot_observed_at":"2026-08-01T18:16:36.917240Z","title":"DialogueGCN: A graph convolutional neural net- work for emotion recognition in conversation,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:36.917240Z"},"links":{"cited_paper":"/paper/1908.11540","citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:e433e2720884ef70e66063a49d391160a61e3187285cd3c3a1cd5c7880b2a426","observation_id":"e24f19b9-767e-4190-ae48-435223b69687","resolution":{"observed_at":"2026-08-01T18:16:36.917240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06779","last_updated":"2021-07-14T15:37:02Z","snapshot_observed_at":"2026-07-06T11:29:07.489964Z","submitted_at":"2021-07-14T15:37:02Z","title":"MMGCN: Multimodal Fusion via Deep Graph Convolution Network for Emotion Recognition in Conversation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06779","snapshot_observed_at":"2026-08-01T18:16:36.990918Z","title":"MMGCN: Multimodal fusion via deep graph convolution network for emotion recognition in conversation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:36.990918Z"},"links":{"cited_paper":"/paper/2107.06779","citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:56964d04070b97c6580b5aad2b2e2b61377ce9aa80169995292a57c438585914","observation_id":"2a491924-c3a7-4bef-baf1-997fcbddadd0","resolution":{"observed_at":"2026-08-01T18:16:36.990918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:16:37.077727Z","title":"Adaptive graph learning for multimodal conversational emotion detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:37.077727Z"},"links":{"citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:d12a2c9143f4bedcf70754cf36e0e00482a112fdddae20ee48999c8bcc794e6f","observation_id":"d964aa04-67ae-44af-856f-6adc362c523a","resolution":{"observed_at":"2026-08-01T18:16:37.077727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:16:37.164205Z","title":"Curriculum learning meets directed acyclic graph for multimodal emotion recogni- tion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:37.164205Z"},"links":{"citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:5bcce1c4915d7a3e51ff4dce7a315190c6b03453649bf66fee128f5be2eb4cfe","observation_id":"65a79210-f24c-4b3b-9f4a-f7f208b16ded","resolution":{"observed_at":"2026-08-01T18:16:37.164205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:16:37.251398Z","title":"DER-GCN: Dialog and event relation-aware graph convolutional neural network for mul- timodal dialog emotion recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:37.251398Z"},"links":{"citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:774d2d3187322ff909ed062eb1070f867e88f28594240b5dcb59f1d61c8cbc0b","observation_id":"1c04a801-583a-4b5c-8bdb-a03c2c5495a0","resolution":{"observed_at":"2026-08-01T18:16:37.251398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:16:37.329172Z","title":"Feature-enhanced multi- modal interaction model for emotion recognition in conversation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:37.329172Z"},"links":{"citing_paper":"/paper/2607.18336"},"observation_digest":"sha256:6df6c3caf4c9a900937c0c661f26e1cfb7d26900194a6512f2a5edf3fc959b55","observation_id":"e13b82e2-f8d0-4269-a435-2087ca86d47b","resolution":{"observed_at":"2026-08-01T18:16:37.329172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.18336","last_updated":"2026-07-19T18:09:22Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-07T17:50:57.330077Z","submitted_at":"2026-07-19T18:09:22Z","title":"EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 1 inbound Pith citation observation for arXiv:2607.18336."}