{"as_of":"2026-08-20T13:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9e476765b61e2991a97a1ec3fc2c22b90db3692ad2257743ffd5865ad0721d7f","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:49:09.335889Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:49:06.392265Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T04:49:09.594801Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"cited_work":{"arxiv_id":"2506.09556","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.09556","snapshot_observed_at":"2026-08-07T04:49:09.594801Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","venue":"cs.CL","work_id":"95acefa2-c474-42da-8f61-c16832e34d66","year":2025},"citing_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:06.392265Z"},"links":{"cited_paper":"/paper/2506.09556","citing_paper":"/paper/2506.09556"},"observation_digest":"sha256:8624ec290adbed92e97379879d8da557167de4d0be37d7fe6cc54e5b764245e7","observation_id":"9badd1b9-a52a-469a-9d80-46af3ab08019","resolution":{"observed_at":"2026-08-07T04:49:09.666502Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.09556/citation-record","integrity":"/paper/2506.09556/integrity","json":"/paper/2506.09556/citation-record.json","paper":"/paper/2506.09556"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:49:15.780226Z","title":"Categorical Emo- tion Recognition","venue":null,"work_id":"9c656961-816b-4e69-92c1-db6124a73754","year":2025},"citing_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:06.275853Z"},"links":{"citing_paper":"/paper/2506.09556"},"observation_digest":"sha256:e3552a77f2fa58cd3c773b49d9b3f616ae1463662203b74cacb003791f763358","observation_id":"d16c6d11-83fe-4131-bab5-2ec70e60726d","resolution":{"observed_at":"2026-08-07T04:49:15.822861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"cited_work":{"arxiv_id":"2506.09556","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.09556","snapshot_observed_at":"2026-08-07T04:49:09.594801Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","venue":"cs.CL","work_id":"95acefa2-c474-42da-8f61-c16832e34d66","year":2025},"citing_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:06.392265Z"},"links":{"cited_paper":"/paper/2506.09556","citing_paper":"/paper/2506.09556"},"observation_digest":"sha256:8624ec290adbed92e97379879d8da557167de4d0be37d7fe6cc54e5b764245e7","observation_id":"9badd1b9-a52a-469a-9d80-46af3ab08019","resolution":{"observed_at":"2026-08-07T04:49:09.666502Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:49:15.674347Z","title":"Overview The novelty of our approach stems from three key directions: 1) architecture, 2) data utilization and 3) training recipe","venue":null,"work_id":"cc674e71-8a7d-4a7b-b536-eb877b7e67c4","year":2025},"citing_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:06.486313Z"},"links":{"citing_paper":"/paper/2506.09556"},"observation_digest":"sha256:ea75a838042ada5bc8b43b64d34bbaa176b10c1d2f2bc9df81abc36fb9493844","observation_id":"12d57c54-07d0-4e7d-ae7f-fe4e76ad3cb5","resolution":{"observed_at":"2026-08-07T04:49:15.724599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:49:15.539800Z","title":"The Stage 3 meta-classifier uses batch size 128 and learning rate 1e-3 without M.MixUp","venue":null,"work_id":"5237dfe1-09e6-43f0-9143-7e0a3faf2bf6","year":null},"citing_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:06.572188Z"},"links":{"citing_paper":"/paper/2506.09556"},"observation_digest":"sha256:585ef60dece62345228d65d38912082e9b8324dc03e4f8a6b3a95cec9907f848","observation_id":"0494fa24-9d83-4d75-81d0-814cf1cf5346","resolution":{"observed_at":"2026-08-07T04:49:15.598901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:49:15.442389Z","title":null,"venue":null,"work_id":"f724bffb-e9fa-4b67-a24c-cff07670cb3f","year":null},"citing_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:06.645168Z"},"links":{"citing_paper":"/paper/2506.09556"},"observation_digest":"sha256:cfd6cdc7349db9dfc76d931d9e59f2061c0d0f24936f5f8eecd0bc3dda609b68","observation_id":"dd6468ea-74ef-4c5e-8316-e55064c069c6","resolution":{"observed_at":"2026-08-07T04:49:15.480102Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:49:15.264986Z","title":null,"venue":null,"work_id":"912d1d2f-e13a-4b71-9d25-7f9c20c60385","year":2025},"citing_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:06.739106Z"},"links":{"citing_paper":"/paper/2506.09556"},"observation_digest":"sha256:7e30fdab8cd784d1aafef866a4d9576a86a60fe995c3d2cdd308390225b9499a","observation_id":"6a057bc7-41f9-428b-939f-0407ed8b9e8c","resolution":{"observed_at":"2026-08-07T04:49:15.359673Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:49:15.061764Z","title":null,"venue":null,"work_id":"6aece4f3-efd9-48c9-bbdf-7b1e3c7a6aa8","year":null},"citing_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:06.818159Z"},"links":{"citing_paper":"/paper/2506.09556"},"observation_digest":"sha256:c57c6accdeefa6e43abdae9ff2744d87f759ceb2040e71f81cc100f4cfacae64","observation_id":"69592d8d-9fb1-4522-9740-adcab9a7dd85","resolution":{"observed_at":"2026-08-07T04:49:15.161502Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:49:14.852989Z","title":"Emotion recognition in human- computer interaction,","venue":null,"work_id":"a002e1e1-5d9a-4254-aa7f-4553efcb223f","year":2001},"citing_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:06.893534Z"},"links":{"citing_paper":"/paper/2506.09556"},"observation_digest":"sha256:2634eeba17426d94529c21952c56ab236df82c7f5648156a4648c6b0c53d04c4","observation_id":"0dad5a84-0db1-4a82-a23b-e883d17b77a9","resolution":{"observed_at":"2026-08-07T04:49:14.924694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:49:14.718944Z","title":"Make patient consultation warmer: A clinical application for speech emotion recognition,","venue":null,"work_id":"77a377e7-9223-4990-8eaa-94126b3dbaa1","year":2021},"citing_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:06.956480Z"},"links":{"citing_paper":"/paper/2506.09556"},"observation_digest":"sha256:e82a4f4e925a1a52dbaa638ddfee011a7e164ea2fcc1503271574af3d8e2d3fe","observation_id":"36caba0a-ec5c-464b-a2d8-a4072a2a11fc","resolution":{"observed_at":"2026-08-07T04:49:14.793854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:49:14.549428Z","title":"Integration of driver be- havior into emotion recognition systems: A preliminary study on steering wheel and vehicle acceleration,","venue":null,"work_id":"0f375297-7524-4189-9ae4-0a29a2fc264f","year":2018},"citing_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:07.031215Z"},"links":{"citing_paper":"/paper/2506.09556"},"observation_digest":"sha256:5721dc3230d1d6d7f39524c43560a7f29f5cdcbcf2e3ff2d8432b4b42a0d36b1","observation_id":"ddd14370-4c88-4304-98eb-0643ee3f4472","resolution":{"observed_at":"2026-08-07T04:49:14.628524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:49:14.361287Z","title":"Call redistribution for a call center based on speech emotion recognition,","venue":null,"work_id":"b33902ab-f523-4909-8b36-e0928f895680","year":2020},"citing_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:07.098384Z"},"links":{"citing_paper":"/paper/2506.09556"},"observation_digest":"sha256:a5a7f18a9d443422fe04bdbba901d42522530edff55535d4990f0bb0a31a53ec","observation_id":"e944c8ae-e12a-4a23-bc6b-7b3964a3cdb8","resolution":{"observed_at":"2026-08-07T04:49:14.462141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:49:14.161533Z","title":"emotion2vec: Self-supervised pre-training for speech emotion representation,","venue":null,"work_id":"b33c857e-ceea-48dd-a77e-b70008bbd157","year":2024},"citing_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:07.181521Z"},"links":{"citing_paper":"/paper/2506.09556"},"observation_digest":"sha256:66c8eec4acbbaaed3c4546ece7c11c80344c5e1b51908b0c5d8eaf60b78db35d","observation_id":"26a9d0b5-8444-4c67-9620-331f874df050","resolution":{"observed_at":"2026-08-07T04:49:14.265007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:49:13.951413Z","title":"Adieu features? end-to-end speech emotion recognition using a deep convolutional recurrent network,","venue":null,"work_id":"5015fe7b-4795-4b8c-bc5a-bbee29492e54","year":2016},"citing_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:07.266815Z"},"links":{"citing_paper":"/paper/2506.09556"},"observation_digest":"sha256:e983f70c67035d4123e06c5d27ecbcd2208db89bcca829e7e4c4e958b6880d8e","observation_id":"1e4348d4-2ca5-4039-aea8-8ffe4ab2c932","resolution":{"observed_at":"2026-08-07T04:49:14.034592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:49:13.747464Z","title":"The interspeech 2025 challenge on speech emotion recognition in naturalistic conditions,","venue":null,"work_id":"4f5f7419-a689-495d-a21e-340f7ef85232","year":2025},"citing_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:07.355321Z"},"links":{"citing_paper":"/paper/2506.09556"},"observation_digest":"sha256:2b053f451e7103757cc6cb97d6b2fc521dc9fbe6776b12c9d1d0f811c5edc72f","observation_id":"d1dd1b22-bb67-460b-9f0f-844433cf70d7","resolution":{"observed_at":"2026-08-07T04:49:13.844521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:49:13.529675Z","title":"Building naturalistic emotionally bal- anced speech corpus by retrieving emotional speech from existing podcast recordings,","venue":null,"work_id":"d1137192-fd17-4f10-8bc5-1e6e607f6be9","year":2019},"citing_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:07.443399Z"},"links":{"citing_paper":"/paper/2506.09556"},"observation_digest":"sha256:236a9d38956b7b8af050d6a3dd15a2c9c0f5b0616ca1e43aab523a53bd8fdee3","observation_id":"3e8f70a8-a254-4928-86a2-3f8df4e160f9","resolution":{"observed_at":"2026-08-07T04:49:13.649321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:49:13.234632Z","title":"Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time,","venue":null,"work_id":"1cc6efaa-ec9a-4b39-9971-d529815b4b7d","year":2022},"citing_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:07.548535Z"},"links":{"citing_paper":"/paper/2506.09556"},"observation_digest":"sha256:eae5a44942fd42c2c98d6aead8e4dc2eccf9330282775e74aaa364ba06e9a221","observation_id":"462c9e3d-d649-46fd-bb64-ddcb91d79659","resolution":{"observed_at":"2026-08-07T04:49:13.366793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:49:13.049889Z","title":"Deep hier- archical fusion with application in sentiment analysis,","venue":null,"work_id":"19a65928-b5ee-4748-9097-7008fd9d1712","year":2019},"citing_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:07.679213Z"},"links":{"citing_paper":"/paper/2506.09556"},"observation_digest":"sha256:060ff63ec2f6ee1412ce46a45206122c79c6df3473b51565325b58ea2be127df","observation_id":"0a85acd4-f961-4969-a404-5ef36734388f","resolution":{"observed_at":"2026-08-07T04:49:13.125839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:49:12.750267Z","title":"Iemocap: Interactive emotional dyadic motion capture database,","venue":null,"work_id":"ebf52d4e-d152-448d-9104-409e04936005","year":2008},"citing_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:07.768729Z"},"links":{"citing_paper":"/paper/2506.09556"},"observation_digest":"sha256:f32a6d0b7fc664822f3285630a214b722bdf3cbdfbaf843a3a67b41175a922a0","observation_id":"c1d370ad-ad16-49ac-9a81-8fccc442f7cd","resolution":{"observed_at":"2026-08-07T04:49:12.902567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:49:12.433419Z","title":"Multimodal language analysis in the wild: Cmu-mosei dataset and interpretable dynamic fusion graph,","venue":null,"work_id":"5cc932dd-c560-496f-9fe3-cc2eeded45b0","year":2018},"citing_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:07.908426Z"},"links":{"citing_paper":"/paper/2506.09556"},"observation_digest":"sha256:8c8258a848f900d1b77a4f21f29c43b2cab85c5c82164265465e536c51db0cb5","observation_id":"8a41fd6d-e4bf-403f-970d-53cc5e70328f","resolution":{"observed_at":"2026-08-07T04:49:12.558675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:49:12.142504Z","title":"A survey of speech emotion recognition in natural environment,","venue":null,"work_id":"00e27993-730d-4544-a2eb-fe094b559d50","year":2021},"citing_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:07.969095Z"},"links":{"citing_paper":"/paper/2506.09556"},"observation_digest":"sha256:7af4ac73bc8862403c990969793ef967735ea0c7f263d36d36d97a5cd2442919","observation_id":"70fe6991-914a-48e8-9c93-61251e71b6df","resolution":{"observed_at":"2026-08-07T04:49:12.291713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:49:11.916675Z","title":"WavLLM: Towards robust and adaptive speech large language model,","venue":null,"work_id":"06113cd8-778a-48f8-bf5e-28814ec8aca6","year":2024},"citing_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:08.021666Z"},"links":{"citing_paper":"/paper/2506.09556"},"observation_digest":"sha256:83c1eecf1b6bcdd59e071e8ad80a2ad79ed8f63954a04482baa429e58a358910","observation_id":"b60dca6a-993c-4f54-b86f-e1dc96de0065","resolution":{"observed_at":"2026-08-07T04:49:12.041077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:49:11.625731Z","title":"Soft-target training with ambiguous emotional ut- terances for dnn-based speech emotion classification,","venue":null,"work_id":"e1cb5c6c-77ce-4564-a638-8870fee2d913","year":2018},"citing_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:08.117496Z"},"links":{"citing_paper":"/paper/2506.09556"},"observation_digest":"sha256:7809cde37e26e84fe7101890d761a8eb849ec93b515526409222f770dcce8d8f","observation_id":"4d577b80-37f9-45ed-aba9-e89ed2092976","resolution":{"observed_at":"2026-08-07T04:49:11.764424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:49:11.357338Z","title":"Manifold mixup: Better represen- tations by interpolating hidden states,","venue":null,"work_id":"38a9da29-0341-484c-8bad-02048ddc7950","year":2019},"citing_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:08.175330Z"},"links":{"citing_paper":"/paper/2506.09556"},"observation_digest":"sha256:133d510a60915474004fff8824d8288edd3431b6b9ee9f83da382ed86fb081f6","observation_id":"815d5e63-b387-41a7-b82a-e473abebfc6b","resolution":{"observed_at":"2026-08-07T04:49:11.484741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:49:11.176030Z","title":"Powmix: A versa- tile regularizer for multimodal sentiment analysis,","venue":null,"work_id":"c0f7f26f-b0b5-4347-aa28-eb284a840e73","year":2024},"citing_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:08.234551Z"},"links":{"citing_paper":"/paper/2506.09556"},"observation_digest":"sha256:bc458dc77a580f5d85d36adc171c142c6366e7c6e360a6ef49bb58c954fcfd38","observation_id":"b4770892-23f7-424b-aa38-1c9c8141cd32","resolution":{"observed_at":"2026-08-07T04:49:11.266365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:49:11.045583Z","title":"Speech emotion recognition with multi-task learning,","venue":null,"work_id":"b7e6fb8b-6a9e-40a5-9862-1d0eb727ad6c","year":2021},"citing_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:08.305637Z"},"links":{"citing_paper":"/paper/2506.09556"},"observation_digest":"sha256:a4013840438708831f5db43917ae6d43cca4185d2fb77d6ea8fee6f7a15a5f16","observation_id":"4d07d30a-53a2-4414-b0d1-c55a0835069b","resolution":{"observed_at":"2026-08-07T04:49:11.110759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20064","last_updated":"2024-05-30T13:55:43Z","snapshot_observed_at":"2026-08-16T13:47:45.314836Z","submitted_at":"2024-05-30T13:55:43Z","title":"1st Place Solution to Odyssey Emotion Recognition Challenge Task1: Tackling Class Imbalance Problem","version":1},"cited_work":{"arxiv_id":"2405.20064","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.20064","snapshot_observed_at":"2026-08-07T04:49:09.479174Z","title":"1st Place Solution to Odyssey Emotion Recognition Challenge Task1: Tackling Class Imbalance Problem","venue":"eess.AS","work_id":"5420df8e-8950-4572-a865-104c0d3e9bd7","year":2024},"citing_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:08.398864Z"},"links":{"cited_paper":"/paper/2405.20064","citing_paper":"/paper/2506.09556"},"observation_digest":"sha256:5a22e3abac6cbb3c6acbc1cc69a251891ac7aa09b2cbba7f525323c56b65d949","observation_id":"a0b28d41-bf57-4949-aeb7-86e82cddf8fe","resolution":{"observed_at":"2026-08-07T04:49:09.548351Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:49:10.915654Z","title":"Meta-classifiers easily im- prove commercial sentiment detection tools,","venue":null,"work_id":"46aa1e17-404c-4e72-90be-89eea84ac82d","year":2014},"citing_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:08.528419Z"},"links":{"citing_paper":"/paper/2506.09556"},"observation_digest":"sha256:ac92d89a49c451c5364d14eefe18ba4a3a01fd5bd1357e7a46edb7633fb58e49","observation_id":"07c27be4-6c06-4774-b74d-2b0d0210aacd","resolution":{"observed_at":"2026-08-07T04:49:10.972515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:49:10.700392Z","title":"Attention is all you need,","venue":null,"work_id":"cbb3ccc9-767e-40ce-9d27-4015eed2a1a2","year":2017},"citing_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:08.636102Z"},"links":{"citing_paper":"/paper/2506.09556"},"observation_digest":"sha256:ee9ff9590bd56152866dab200265b4efcf267891f81eaef080877d1c16f28d2e","observation_id":"d4f1aed8-ee61-4753-9e18-001f4ba3cb8e","resolution":{"observed_at":"2026-08-07T04:49:10.786076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:49:10.565625Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":"7873f75b-3aa2-4229-889e-9ad1c2ef421a","year":2022},"citing_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:08.723671Z"},"links":{"citing_paper":"/paper/2506.09556"},"observation_digest":"sha256:60b82264f7beb72b9563668007d87ec23bb5e8e43f78c23e776c33a7f954522d","observation_id":"719d48d6-3b68-4008-9942-34204805d496","resolution":{"observed_at":"2026-08-07T04:49:10.600445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:49:08.809717Z","title":"Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:08.809717Z"},"links":{"citing_paper":"/paper/2506.09556"},"observation_digest":"sha256:5a1584467960d209e068013259cbe38cf638d8aac29969c4aa8f54760c285bcc","observation_id":"d896ca3b-cecd-4987-a3a0-3f472e2848c9","resolution":{"observed_at":"2026-08-07T04:49:08.809717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:49:08.900960Z","title":"Robust speech recognition via large-scale weak su- pervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:08.900960Z"},"links":{"citing_paper":"/paper/2506.09556"},"observation_digest":"sha256:82af98891ed77cfc93bd90c1da6ce8384a0e4d79060ab9dbf53864f22d508f5c","observation_id":"b7a0a019-5306-4013-80b2-77b90dbf5bfe","resolution":{"observed_at":"2026-08-07T04:49:08.900960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:49:08.985412Z","title":"Roberta: A robustly optimized bert pretraining approach,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:08.985412Z"},"links":{"citing_paper":"/paper/2506.09556"},"observation_digest":"sha256:b4c1548b2b5dcbfd50f9571c4c9bdb1833b5a111feecced3999207cdf08266c4","observation_id":"9d6105cb-5681-4626-9ecb-d3e791be2d64","resolution":{"observed_at":"2026-08-07T04:49:08.985412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:49:10.366215Z","title":"Smarter, better, faster, longer: A modern bidirectional encoder for fast, memory efficient, and long context finetuning and inference,","venue":null,"work_id":"6bed877d-c815-45c8-ae3c-9d6f779abdc3","year":2024},"citing_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:09.045868Z"},"links":{"citing_paper":"/paper/2506.09556"},"observation_digest":"sha256:a79e5039ef32855999dd7741abf69b883d580fcd66174e0fd5640cee24a82c5b","observation_id":"f6fa6fb4-aab2-4edd-b0c2-793f97481112","resolution":{"observed_at":"2026-08-07T04:49:10.433802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:49:09.118064Z","title":"Long short-term memory,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:09.118064Z"},"links":{"citing_paper":"/paper/2506.09556"},"observation_digest":"sha256:6d1756659f49c6c13842f77cf628c3eefb94ff4fdd6598521bef7ce05f154938","observation_id":"cf9926c2-6b78-4f5a-8195-5296dfea9d97","resolution":{"observed_at":"2026-08-07T04:49:09.118064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:49:10.170251Z","title":"Vicinal risk minimization,","venue":null,"work_id":"c6426c27-b483-466c-84e7-a89192e6d882","year":2000},"citing_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:09.214257Z"},"links":{"citing_paper":"/paper/2506.09556"},"observation_digest":"sha256:799106e55d783188d6dcba1dd2369df4b160d682532de9b67f903227d9223c54","observation_id":"344cae71-43c8-46cd-8ee7-93313d28eced","resolution":{"observed_at":"2026-08-07T04:49:10.253030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:49:09.993227Z","title":"Decoupled weight decay regulariza- tion,","venue":null,"work_id":"c4f56202-ab29-4131-a2ed-85308984448b","year":2019},"citing_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:09.272425Z"},"links":{"citing_paper":"/paper/2506.09556"},"observation_digest":"sha256:cc7a7f58a76eb9849a7a5f5f2a12b99a1d785a8460b0bbee0721b98b0b3aeca8","observation_id":"8add645e-4b2c-443b-b366-0b70293a58ce","resolution":{"observed_at":"2026-08-07T04:49:10.084078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:49:09.813675Z","title":"Py- torch: An imperative style, high-performance deep learning li- brary,","venue":null,"work_id":"d15979cf-6930-454c-b9f3-365c52449796","year":2019},"citing_paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:09.335889Z"},"links":{"citing_paper":"/paper/2506.09556"},"observation_digest":"sha256:ebaa50646aad301587566166cb19eb5b0ca27b347648db8daaa98270848aaee2","observation_id":"b42fd3f9-8335-4f7a-8ef7-22e8bcfa5736","resolution":{"observed_at":"2026-08-07T04:49:09.907373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.09556","last_updated":"2025-09-04T10:18:13Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-14T07:13:17.323940Z","submitted_at":"2025-06-11T09:41:23Z","title":"MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":7,"verified_exact":1,"verified_fuzzy":28},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 1 inbound Pith citation observation for arXiv:2506.09556."}