{"as_of":"2026-08-06T20:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:544bc843906ec65a4ab11a6d001188d544787c7cb6ccccc162d1f7b750deded5","coverage":[{"denominator":79,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T18:07:34.965356Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.08470/citation-record","integrity":"/paper/2509.08470/integrity","json":"/paper/2509.08470/citation-record.json","paper":"/paper/2509.08470"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adaptive virtual assistant interaction through real-time speech emotion analysis using hybrid deep learning models and contextual awareness","venue":null,"work_id":"727d7d09-055d-46f4-97fe-83256ceb8914","year":2023},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:c9c17ddfc16084d3647d2c0e7461bdba2e35cf8b6047a64e5096fe8bf6ced7dc","observation_id":"968f2eaf-86bb-4419-92be-9e0594aa184d","resolution":{"observed_at":"2026-05-18T18:12:47.066207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Real-time speech emotion analysis for smart home assistants","venue":null,"work_id":"127cefc0-94a1-4b1f-802b-04a9932559c4","year":2021},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:7432683ee37097da3d48c5a5c7973368ce34cca62defd751215ff46f67bc3c12","observation_id":"bd8114d6-46e2-4602-9461-d8f250d7d107","resolution":{"observed_at":"2026-05-18T18:12:47.061054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enabling intelligent environment by the design of emotionally aware virtual assistant: A case of smart campus","venue":null,"work_id":"84518b39-9928-4b64-ac07-5bb7efe291b8","year":2020},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:dabce23d38bed0abc3900812646056aa77e3f655c617765e492258baf58f5e7f","observation_id":"983bafcb-ea7f-426f-aabf-2fafa60d3384","resolution":{"observed_at":"2026-05-18T18:12:47.058750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multilayer neural network based speech emotion recognition for smart assistance","venue":null,"work_id":"1c98bb95-3469-4e42-9cd2-60ff0b2cd520","year":2023},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:a20afd31b0a8c8536fbbcbf43c02ec6aa43c2f9ec974f9ed64c4e72f6f684c99","observation_id":"1abf6996-76fd-4683-b4e1-266bb66deba4","resolution":{"observed_at":"2026-05-18T18:12:47.056165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Speech emotion recognition using supervised deep recurrent system for mental health monitoring","venue":null,"work_id":"91bf40e6-f996-429e-9986-7e6959e97439","year":2022},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:05b463ce7ff0c61a484d1d678463d9795a3708d21aec45f5605139494fb2cb74","observation_id":"7ce1ee30-9f27-416b-903b-ce469827b1ec","resolution":{"observed_at":"2026-05-18T18:12:47.050798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Automatic speech emotion recognition using machine learning: digital transformation of mental health","venue":null,"work_id":"62f8b0ff-4526-4e56-94c7-3479fcd9d8b8","year":2022},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:2ed80b94df481fde656c74b05ee3ecdfa49d6ff6349f00bb5b52f7f1f6c6708c","observation_id":"1b9c282b-1973-40ab-99d1-4190196899e9","resolution":{"observed_at":"2026-05-18T18:12:47.047961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Depression severity classification from speech emotion","venue":null,"work_id":"fa7fc1bf-031f-40b7-bff1-4a12ca4bea43","year":2018},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:6718ce0929a8f06c96d1732775607e6768c2a4b6d9fd6b922a5e174a28a72a76","observation_id":"95479e18-0fd4-4012-b244-99fc31a19311","resolution":{"observed_at":"2026-05-18T18:12:47.044945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Speech emotion recognition for power customer service","venue":null,"work_id":"d64849de-c547-421a-ac47-c55cf8b8655e","year":2021},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:70d375d8b1be8a8eed8d8169ffcfb4e67d5d81e2aa361d877fcf2397b99260d1","observation_id":"0d7d103f-83e6-48f3-82cd-2b0038bde838","resolution":{"observed_at":"2026-05-18T18:12:47.042015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ordinal learning for emotion recognition in customer service calls","venue":null,"work_id":"0c3fb21f-6eb8-4f9f-8d42-46d4e093ff3d","year":2020},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:353365fc9637c2cb48b53987d211224d1ea60771a35d5dbab00f9e9dcc9e0c63","observation_id":"922fb80b-85e2-40ad-99c8-5ec7619c0a2d","resolution":{"observed_at":"2026-05-18T18:12:47.053391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to-end continuous speech emotion recog- nition in real-life customer service call center conversations","venue":null,"work_id":"e34bce6a-6578-47f5-b761-ebdad9c8776c","year":2023},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:be633f2139469cc92150c3bd5425c6547d7ac176c5993d86f6f6477ce7b4bad7","observation_id":"ccdccf42-f9d6-4a2d-a4d9-d545d77aba0b","resolution":{"observed_at":"2026-05-18T18:12:47.071608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Front-end feature compensation and denoising for noise robust speech emotion recognition","venue":null,"work_id":"86a0b50e-930d-40e7-a99d-2d25030bd784","year":2019},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:0028ff59f76acc45f2d41521404dcb304b11eb8c3cbf890548542a17a8a36e1c","observation_id":"f76462f8-9290-436b-b72c-a074ebfbc657","resolution":{"observed_at":"2026-05-18T18:12:47.068814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emotion recognition in the noise applying large acoustic feature sets","venue":null,"work_id":"93e85aeb-416e-4bf6-9b1b-2f87db01e53d","year":2006},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:54878e0450b8c87d6eac2a181a6cbf9ef1c56374219cf5975bd6910f96dca859","observation_id":"3c966493-ebdb-46c9-b0ab-d5582ab5ad2c","resolution":{"observed_at":"2026-05-18T18:12:47.063374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Not all features are equal: Selection of robust features for speech emotion recognition in noisy environments","venue":null,"work_id":"29261e0b-20b1-4b62-b497-53dabb5fdf84","year":2022},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:acb882a46fda09ad547afb0b151c6162e3b5f43265ceb61ae791e67583943b29","observation_id":"22a130b7-3990-44e9-aeb4-d2156d7d3552","resolution":{"observed_at":"2026-05-18T18:12:47.074562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Metricaug: A distortion metric-lead augmen- tation strategy for training noise-robust speech emotion recognizer","venue":null,"work_id":"8187a54b-5606-4e1d-a6b2-382f48d664fe","year":2023},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:dac187dbce63fe5db4247d11ae036fe897cf88ddd1bcb60029295809f89eb69d","observation_id":"370f353c-9368-45d0-b736-a8b826dc44c1","resolution":{"observed_at":"2026-05-18T18:12:47.120977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08806","last_updated":"2023-08-31T18:26:56Z","snapshot_observed_at":"2026-07-06T11:01:05.577957Z","submitted_at":"2021-04-18T10:33:38Z","title":"Best Practices for Noise-Based Augmentation to Improve the Performance of Deployable Speech-Based Emotion Recognition Systems","version":2},"cited_work":{"arxiv_id":"2104.08806","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08806","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Best practices for noise-based augmen- tation to improve the performance of deployable speech-based emotion recognition systems","venue":null,"work_id":"fec63e93-fb52-4c55-91d1-75c782100b20","year":2021},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"cited_paper":"/paper/2104.08806","citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:f8b6f21f8a6b346cd3ac0ae5ff78aaacb626cdbf3571abc952f352781daeacec","observation_id":"31b52eed-be17-4c28-a523-63ed7a307f51","resolution":{"observed_at":"2026-05-18T18:11:42.923961Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement learning based data augmentation for noise robust speech emotion recognition","venue":null,"work_id":"9a6330e7-c36b-4e88-b827-f73dd8fd5b2e","year":2024},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:a04f79c3152a8ffb866d2079bd814bb9d22d631878a10316745d14a24416de61","observation_id":"2d99b63a-253b-4abc-976e-58cbaa1a104d","resolution":{"observed_at":"2026-05-18T18:12:47.118023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-conditioning and data augmentation using generative noise model for speech emotion recognition in noisy conditions","venue":null,"work_id":"e1787a87-801f-4afd-b809-1ded6b8bbe91","year":2020},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:d395e6419bf81aa5092029e5bd83fe11ea9c3dda27edd49473e7905ea7c41a3f","observation_id":"dcb37d9f-c029-432b-8486-4038483a28b6","resolution":{"observed_at":"2026-05-18T18:12:47.115139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Com- putation and memory efficient noise adaptation of Wav2Vec2.0 for noisy speech emotion recognition with skip connection adapters","venue":null,"work_id":"3ee72057-57dd-4547-94e2-bc3ac956b8aa","year":2023},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:bf1dc992a928ff45b22120b9300d195bab97da7dc1cb8e22f8e02732afcac7ed","observation_id":"5852c649-7254-4fb6-9a3d-5259216fb7cb","resolution":{"observed_at":"2026-05-18T18:12:47.111981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2407.17716","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Describe where you are: Improving noise-robustness for speech emotion recognition with text description of the environment","venue":null,"work_id":"e0246636-2f75-420b-b539-eadde0174cc2","year":2024},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:548288da6c930d38328182447f16624712c8f12afb3bf0e633d39b395c61673c","observation_id":"6e21ea88-c031-4136-bb74-22c770fe6a86","resolution":{"observed_at":"2026-05-18T18:11:42.933195Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards noise robust speech emotion recog- nition using dynamic layer customization","venue":null,"work_id":"2239c285-46f1-47ca-8e18-782fb111f860","year":2021},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:3034d4bf557c4c4d4f27bc496d4e36873a4e934c6b4b928ba70d2ef8dee15c3a","observation_id":"755e7124-303b-454e-baa9-54b520caf8b7","resolution":{"observed_at":"2026-05-18T18:12:47.108775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Separation of emotional and reconstruction embeddings on ladder network to improve speech emotion recognition robustness in noisy conditions","venue":null,"work_id":"9d6feaa3-cc49-4061-b08e-484bc1d1d5df","year":2021},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:4e0425213a5c4c6092e8febf4462329e57e095234001d3d2c743b3919e7e1a2e","observation_id":"5d6ef8d5-e315-436d-aecc-7dbc4888f820","resolution":{"observed_at":"2026-05-18T18:12:47.104961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adapting a self-supervised speech representation for noisy speech emotion recognition by using contrastive teacher-student learning","venue":null,"work_id":"bfdbc727-4c67-471c-b96a-5b50ee92bf14","year":2023},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:dcbf1addd340b478b4f10f16971866df9f5c2792f7d98ebd5d9e3ba5ca334a1f","observation_id":"32377f04-01c5-4fb1-bddd-d0614b598c24","resolution":{"observed_at":"2026-05-18T18:12:47.101752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to-end speech emotion recognition: Challenges of real-life emergency call centers data recordings","venue":null,"work_id":"3101b5e8-216c-4a1f-8a6f-75b5402b7c6b","year":2021},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:147885f05a11089c4cd825926251479d7425a6bccf0c8f72451605d5b55646ac","observation_id":"097f9fc4-b8f3-4ce5-b905-4f9093908a7e","resolution":{"observed_at":"2026-05-18T18:12:47.098857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enhancing emergency response through speech emotion recognition: A machine learning approach","venue":null,"work_id":"570dcedf-4836-49f7-a7d3-916845ec3258","year":2023},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:a59f1e9f2afc580469a765f77308a2e7996260270ce956b26510e068c38b1c97","observation_id":"d59e1787-0cdf-4e07-b11f-0c0a4d2aa743","resolution":{"observed_at":"2026-05-18T18:12:47.095705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Investigating trans- former encoders and fusion strategies for speech emotion recognition in emergency call center conversations","venue":null,"work_id":"bedf0ad9-4911-4721-a9c1-d90cf706388d","year":2022},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:50793cb5e2ce6590c37eebfab9d9776943093922e9a0f10f8302d6190f3179cb","observation_id":"4e8d1af0-9c34-4c9c-b359-f49343ca91df","resolution":{"observed_at":"2026-05-18T18:12:47.092547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards robust speech emotion recognition using deep resid- ual networks for speech enhancement","venue":null,"work_id":"dfa4b03e-e093-41cf-bdca-ec82065d40f9","year":2019},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:818721468b5837dc78b33b5488fe185f73ea4b504a386fc26b960c09c061ec01","observation_id":"9b03a06e-19f1-4e4b-8d5b-382768b5cfdc","resolution":{"observed_at":"2026-05-18T18:12:47.086289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T07:53:27.826431Z","title":"Task-specific speech enhancement and data augmentation for improved multimodal emotion recognition under noisy conditions","venue":null,"work_id":"e1dbfc9b-9592-4abd-b100-ac9f08314bde","year":2023},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:54ead8dcbcef8bceb4650f2f404bf56f012f6f759771704574369fc2c63b53f2","observation_id":"2569233e-90a6-46ae-bca9-310ecf232444","resolution":{"observed_at":"2026-05-18T18:12:47.083039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01164","last_updated":"2023-09-03T13:00:04Z","snapshot_observed_at":"2026-08-03T15:30:39.358724Z","submitted_at":"2023-09-03T13:00:04Z","title":"Noise robust speech emotion recognition with signal-to-noise ratio adapting speech enhancement","version":1},"cited_work":{"arxiv_id":"2309.01164","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.01164","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Noise robust speech emotion recognition with signal-to-noise ratio adapting speech enhancement","venue":null,"work_id":"79c3d7b8-0418-4cf4-88b8-a8a07d38fd1f","year":2023},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"cited_paper":"/paper/2309.01164","citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:f3001fede54da4e8d5468bd42d655b162caeba333b520d41f2422ef06ea1c6bf","observation_id":"50a4916a-805d-4845-973f-0c89be4b9b01","resolution":{"observed_at":"2026-05-18T18:11:42.895985Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Investigating speech enhancement and perceptual quality for speech emotion recog- nition","venue":null,"work_id":"f890500d-d412-43e5-9b28-4d5e1e770da8","year":2018},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:c373cf4def4a66ce1e69a36093cca0fa74d4c4feca1f5954fb51237f2b75e709","observation_id":"d8b2678e-efd6-42c0-9e8a-56e05ae81ff9","resolution":{"observed_at":"2026-05-18T18:12:47.079389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Noise-robust speech emotion recognition using shared self-supervised representations with integrated speech enhancement","venue":null,"work_id":"36dccc7b-672f-4144-83a8-cb9a625df35c","year":2025},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:8baf222fce04bd5494d98daf97e584913a4dc02d6d0b0b46f45591bf5acb3892","observation_id":"6d458e9d-25bc-4a28-a631-b1994066793d","resolution":{"observed_at":"2026-05-18T18:12:47.075942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gradnorm: Gradient normalization for adaptive loss balancing in deep multitask networks","venue":null,"work_id":"88e1adc1-de23-4bf1-b6b3-1c3c7d5a33bd","year":2018},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:fc2053592040578ded5ad5678c1c78033ea5c1e7abd5fd04c0ced3a3728e9886","observation_id":"78513609-3793-46d0-97b7-fac9b6c59924","resolution":{"observed_at":"2026-05-18T18:12:47.072804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T16:13:58.836232Z","title":"Gra- dient surgery for multi-task learning","venue":null,"work_id":"4466d62d-5896-4665-b008-2e4947694c24","year":2020},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:f9d807fc67e86e2bd0810c6c008ac29689fb72b36e5ec8929c80ceb9fb33b0d2","observation_id":"b6ded5be-c5e9-419f-aad0-e85d36a2b5c3","resolution":{"observed_at":"2026-05-18T18:12:47.069595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Modeling task relationships in multi-task learning with multi-gate mixture-of-experts","venue":null,"work_id":"a65bda3e-b11a-46b7-bf4c-1fea1e50ef9b","year":2018},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:1baa562666ba0f3d295332e328aca4bdd78137687690bc12116615527891958f","observation_id":"e641dc9f-84ed-49bf-b1b2-5b7067dfd319","resolution":{"observed_at":"2026-05-18T18:12:47.066645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Building Naturalistic Emotionally Balanced Speech Corpus by Retrieving Emotional Speech From Existing Podcast Recordings","venue":null,"work_id":"a6d1b4cc-d7d5-4111-bd83-34487d0d5a37","year":2019},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:9ec87fd5fe628719f9b8b633eba081411e312d03857460915c268b951fa84e1e","observation_id":"2063838f-74cf-45d8-a8ef-2689a8a6d6ff","resolution":{"observed_at":"2026-05-18T18:12:47.063654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Odyssey 2024 - speech emotion recognition challenge: Dataset, baseline framework, and results","venue":null,"work_id":"a1ea6190-881a-4fef-ad2a-b57e4866dfbb","year":2024},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:efb0ebb145d72553ee13448ea9fa1f530d7b0eeb02d8fa74d7182fe2559ec7d6","observation_id":"64a50563-27cc-4641-b56c-f066d5dcbec6","resolution":{"observed_at":"2026-05-18T18:12:47.060397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Selective acoustic feature enhancement for speech emotion recognition with noisy speech","venue":null,"work_id":"0159e41c-9aaf-4de9-bf10-2c3bf06085f3","year":2024},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:aedbd40c91ac9c966a4628a580ed13d2ec18eefad258782080a2d71029bd3fe7","observation_id":"f3d24484-a8bd-42f7-be34-e3f8184ed6ec","resolution":{"observed_at":"2026-05-18T18:12:47.057270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust front-end processing for emotion recognition in noisy speech","venue":null,"work_id":"abf52a32-4c95-41eb-98d6-d02c9b027402","year":2018},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:f183035a8c332f0d0f0e759a399f081ccc359ec50749de225ec885a77e45790e","observation_id":"9bc205f6-3ef7-4d83-b32f-a23ee77b718d","resolution":{"observed_at":"2026-05-18T18:12:47.054092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An unsupervised frame selection technique for robust emotion recognition in noisy speech","venue":null,"work_id":"2d5855e2-2c90-4813-a704-fd62169ac796","year":2018},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:66490d0931066dfa80243e12778ac944968cdb9f18d4f88e3ff6c98cfd859f71","observation_id":"aff19d53-7d39-4095-a6a0-96fed41fa55a","resolution":{"observed_at":"2026-05-18T18:12:47.123822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Keep, delete, or substitute: Frame selection strategy for noise-robust speech emotion recognition","venue":null,"work_id":"e78a07d3-1086-41e3-a557-5793f63b041d","year":2024},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:6af88b89745e6053b6b20f527e1e92e5e817308cb4ab12ee7ee9a5113992832b","observation_id":"a0741320-4361-440d-95d7-af820bf39628","resolution":{"observed_at":"2026-05-18T18:12:46.962155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From neural pca to deep unsupervised learning","venue":null,"work_id":"ca319069-6b24-4a33-9ea8-42d4077bff76","year":2015},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:377aff98f930d1a4b8d2d8afc68358824db22154ea3555685664fb40af564525","observation_id":"850ae2c6-81c7-40c7-bdeb-9f41d29340c3","resolution":{"observed_at":"2026-05-18T18:12:46.990015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Semi-supervised speech emotion recog- nition with ladder networks","venue":null,"work_id":"7dadda9d-7904-4974-811f-5bbddf892ad4","year":2020},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:bb3b6c9a96c543c97aeefe97c94afd827dff5e8c84b58837133c37bf6ae70e00","observation_id":"fb6b72cb-291f-42f8-9e89-592d358a81b5","resolution":{"observed_at":"2026-05-18T18:12:47.023698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Domain separation networks","venue":null,"work_id":"a90431a6-6293-453c-b6d4-7519d97c6e20","year":null},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:7dd1bc15bb32e5c102c951aa0e3fe6b5f6d7b9ffb57d672b3eba76c767f195c9","observation_id":"d2231539-a6b6-4bb7-abdb-361444a8024b","resolution":{"observed_at":"2026-05-18T18:12:47.005608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Available: https://proceedings.neurips.cc/paper files/ paper/2016/file/45fbc6d3e05ebd93369ce542e8f2322d-Paper.pdf","venue":null,"work_id":"1ef68997-d666-434a-b9bf-99639696be72","year":2016},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:d18715ecb625a35bd003284e80a6529f9b9237f5bed89a3b403f1b3e633880c6","observation_id":"ed63388c-1d8b-485d-8904-ada5f7315f21","resolution":{"observed_at":"2026-05-18T18:12:47.047746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spectral feature mapping with mimic loss for robust speech recognition","venue":null,"work_id":"01f350b4-5072-4a7e-b68d-8db6492d0467","year":2018},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:5498c98fd32ec0ecbf5a18c6b181531db90770be9996c66430231a048a167c0f","observation_id":"1a8a72f8-f31b-4085-9a9e-6dd06c8247ec","resolution":{"observed_at":"2026-05-18T18:12:47.032399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Capturing long-term temporal dependencies with convolutional JOURNAL OF LATEX CLASS FILES","venue":null,"work_id":"b67e92f7-e1bc-4503-99a0-c6faffec76fc","year":2021},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:4fe38dd9eeae88ca470c3f25bb5351849e7b580f814442fcad712903d891cad7","observation_id":"48be5463-bf78-4169-afe0-cab81771cf14","resolution":{"observed_at":"2026-05-18T18:12:47.038535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Versa- tile audio-visual learning for emotion recognition","venue":null,"work_id":"b6c6ade6-0ed2-4c7b-b7e0-2edb4ed120f7","year":2025},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:ab6866e7b2d0463ec0067328e618b43f57309624f665163b2992f12f23f83c6a","observation_id":"e6f9174b-0107-4010-abf2-65acfe0c2735","resolution":{"observed_at":"2026-05-18T18:12:47.035139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T07:32:02.076764Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations","venue":null,"work_id":"462c1fb9-95c6-413f-a73f-dc5ad9aa8859","year":2020},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:c02e5e6bd0dc3ad106c221fd3319afeac15735a488e67731b35081508f098b8c","observation_id":"19aea5bd-e845-4ea4-a8a0-58e59fc2a3c8","resolution":{"observed_at":"2026-05-18T18:12:47.017644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:55.929779Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units","venue":null,"work_id":"7490689b-1e6b-4856-b4e3-803ae1e3fab1","year":2021},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:334953be6342193b3bc989230d1d94b8487adaaab4bc326c191cf0906eebb8ca","observation_id":"1bc95bb3-1ed9-40c5-8ff5-4486610ed2c1","resolution":{"observed_at":"2026-05-18T18:12:47.022244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:55.918403Z","title":"Wavlm: Large-scale self-supervised pre- training for full stack speech processing","venue":null,"work_id":"2520f0fc-fb5e-4d3d-bd23-a4d85fc4a9ec","year":2022},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:35807daa8281e4cb554295bde6f250c0bcbe25235c86049652816b4948ae3036","observation_id":"d39cd630-fe9a-4c45-80f3-7b682c7d13fc","resolution":{"observed_at":"2026-05-18T18:12:47.044800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-07-06T11:05:55.984799Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:c8117f108487af8867270a9f0ca701685be761a1b2afaa1454e9349a342a463b","observation_id":"a697c031-e64b-4621-b4ed-b4c604146834","resolution":{"observed_at":"2026-05-18T18:11:42.900862Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SUPERB-SG: Enhanced speech processing universal PERformance benchmark for semantic and generative capabilities","venue":null,"work_id":"afa5a561-248d-4da9-a2ee-f9e0e50fc4f5","year":2022},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:c52bf6998ea778b865ddf53f9b70e8b2098e51879fa0234f389a070f231c63a8","observation_id":"3d353bae-26c2-4177-8a52-d3a67335a749","resolution":{"observed_at":"2026-05-18T18:12:47.051095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Boosting self-supervised embeddings for speech enhancement","venue":null,"work_id":"f6415c83-c66f-41a2-b6e7-1835a11c1c87","year":2022},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:d7030431b5488848cbb12ea1fc3ab32c40587ab3ea17fba177ef36180817ab7e","observation_id":"a9948a2c-6dcf-40d5-afa6-c26d157c0ab9","resolution":{"observed_at":"2026-05-18T18:12:47.041785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring wavlm on speech enhancement","venue":null,"work_id":"6750ccdc-b5ce-4ce2-8747-4561712723fb","year":2023},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:2fb428073913c3e5288cad9f607bcfb5c9d2114eb89c82a6b74e5007cb4e5a7f","observation_id":"dc20d747-0f0a-4bf5-bd63-a3da43a0a23a","resolution":{"observed_at":"2026-05-18T18:12:47.038756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Speech enhancement using self- supervised pre-trained model and vector quantization","venue":null,"work_id":"141b4545-498d-4065-b46c-f6fb1a46866e","year":2022},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:fd6539c79b82b0ebe028b7ae4875f25de0fce711bf78d53ce325e416b41ddc62","observation_id":"27d854cb-24c1-44c0-aafe-1a7749c392d7","resolution":{"observed_at":"2026-05-18T18:12:47.026467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02735","last_updated":"2022-10-03T20:50:54Z","snapshot_observed_at":"2026-07-06T12:05:22.076764Z","submitted_at":"2021-11-04T10:39:06Z","title":"A Fine-tuned Wav2vec 2.0/HuBERT Benchmark For Speech Emotion Recognition, Speaker Verification and Spoken Language Understanding","version":3},"cited_work":{"arxiv_id":"2111.02735","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.02735","snapshot_observed_at":"2026-07-11T01:57:52.037436Z","title":"A fine-tuned wav2vec 2.0/hubert benchmark for speech emotion recognition, speaker verification and spoken language understanding","venue":"cs.CL","work_id":"6bb9f860-e45b-4ceb-8ca3-17d38124e800","year":2021},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"cited_paper":"/paper/2111.02735","citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:9862e2f671c271a6e7f4ba125c5311986e49f03fe97e3bd507dd760b2b176141","observation_id":"1e3e4584-8631-45dc-bd6b-8fad767f7957","resolution":{"observed_at":"2026-05-18T18:11:42.905106Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evaluating self-supervised speech repre- sentations for speech emotion recognition","venue":null,"work_id":"0e6a195c-8125-4ad4-b4ef-93094d8c0fb9","year":2022},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:9d21fc402325248e1c5a5cf30086f44a44e666559d342b3a18f45c5f2a5805d5","observation_id":"c1c74f9a-6b56-4579-8999-0ed0a76d1799","resolution":{"observed_at":"2026-05-18T18:12:47.089507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Interspeech 2025 challenge on speech emotion recog- nition in naturalistic conditions","venue":null,"work_id":"89fa7617-68a4-4251-963f-d762f5895e4f","year":2025},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:7265c4817e99872706d3d363e2b59f592b8f04f82fde9cc54309026802421eeb","observation_id":"75ab2082-fc4d-405c-8dfc-345bbedd81e4","resolution":{"observed_at":"2026-05-18T18:12:47.030703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06114","last_updated":"2016-03-01T10:55:58Z","snapshot_observed_at":"2026-08-01T19:23:26.365417Z","submitted_at":"2015-11-19T10:24:14Z","title":"Multi-task Sequence to Sequence Learning","version":4},"cited_work":{"arxiv_id":"1511.06114","doi":null,"metadata_source":"pith","pith_arxiv_id":"1511.06114","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-task Sequence to Sequence Learning","venue":"cs.LG","work_id":"3e9cf9b4-81f5-468e-acbc-573246848296","year":2015},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"cited_paper":"/paper/1511.06114","citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:9dba84dd8b9fec200d4eb63c2cd63262658ed9baddd754d293112989b06da9ff","observation_id":"591b3a78-129a-49f3-8ff4-088a121f1115","resolution":{"observed_at":"2026-05-18T18:11:42.909480Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05137","last_updated":"2017-06-16T03:10:03Z","snapshot_observed_at":"2026-08-04T13:02:46.926323Z","submitted_at":"2017-06-16T03:10:03Z","title":"One Model To Learn Them All","version":1},"cited_work":{"arxiv_id":"1706.05137","doi":"10.1038/492345a","metadata_source":"pith","pith_arxiv_id":"1706.05137","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"One Model To Learn Them All","venue":"cs.LG","work_id":"eff585be-2f4b-4797-95cf-33506753e92a","year":2017},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"cited_paper":"/paper/1706.05137","citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:033458a0596a1d85da782aabbfff06cd4af171eaf748ee5a7aa49da8ace0cd94","observation_id":"5433896a-935c-4b9d-bacb-51cd6b0e4992","resolution":{"observed_at":"2026-05-18T18:11:42.927997Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-task learning using uncer- tainty to weigh losses for scene geometry and semantics","venue":null,"work_id":"459c6375-10b5-4e87-8afa-69769f6b5271","year":2018},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:6d742c5d44cb2263f6b9e50468b3adbc3e2d93641dade784ce6b76771b0d5d94","observation_id":"fa531c20-80b9-4256-8841-104f6e31ded8","resolution":{"observed_at":"2026-05-18T18:12:47.008640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.07689","last_updated":"2022-04-16T00:56:12Z","snapshot_observed_at":"2026-08-06T20:30:25.020976Z","submitted_at":"2022-04-16T00:56:12Z","title":"Sparsely Activated Mixture-of-Experts are Robust Multi-Task Learners","version":1},"cited_work":{"arxiv_id":"2204.07689","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2204.07689","snapshot_observed_at":"2026-07-02T01:06:24.680720Z","title":"2022 , journal =","venue":null,"work_id":"d1e7e56b-f7d4-448d-a949-15aa290c4d3a","year":2022},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"cited_paper":"/paper/2204.07689","citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:fe5f080b428c3b0f8a4c60fa2da354041acd0805a10ef654edc8e90a82d0442b","observation_id":"e7811c61-a20d-4bbc-b274-464d4a9f3f10","resolution":{"observed_at":"2026-05-18T18:11:42.943471Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T10:47:02.704538Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity","venue":null,"work_id":"5514bd0c-8b3f-4229-9b40-218054917419","year":2022},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:0553fd8c24bee6d9b774bb33025dc0f712b217c54f0d3000d2ac21a84074f292","observation_id":"f57cc905-d4e5-4880-bbe9-a6443c09d996","resolution":{"observed_at":"2026-05-18T18:12:46.999680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":"2401.04088","doi":"10.48550/arxiv.2401.04088","metadata_source":"pith","pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixtral of Experts","venue":"cs.LG","work_id":"0de8c352-9daa-4e1e-8c7b-3d0dec69f369","year":2024},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:43a0668b978ba8f661b1e023a4a122703e89c713ef5ba4ce5573a41898c62cf4","observation_id":"39b9fbbc-bc6d-4ecd-bd22-e2be10938a03","resolution":{"observed_at":"2026-05-18T18:11:42.891629Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:39.110013+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:39.110013+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:492997470e179ad1d5747c61f0afa829a681acd8d680b6b3a4eb165e25109507","observation_id":"2095a126-c9e3-4657-8ba8-dd0ae68f2382","resolution":{"observed_at":"2026-05-18T18:11:42.914147Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16554","last_updated":"2024-06-24T11:43:07Z","snapshot_observed_at":"2026-07-06T18:35:59.208843Z","submitted_at":"2024-06-24T11:43:07Z","title":"LLaMA-MoE: Building Mixture-of-Experts from LLaMA with Continual Pre-training","version":1},"cited_work":{"arxiv_id":"2406.16554","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.16554","snapshot_observed_at":"2026-07-02T23:07:26.954408Z","title":"Barret Zoph, Irwan Bello, Sameer Kumar, Nan Du, Yanping Huang, Jeff Dean, Noam Shazeer, and William Fedus","venue":null,"work_id":"8a60caac-fc1e-4de0-a4e3-8cde6cba8221","year":2022},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"cited_paper":"/paper/2406.16554","citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:33fae861a4441170d1ce3ec2b7c96209c2e272be732b25e82555b713711a6eac","observation_id":"49b32749-8ee2-4538-b980-47f77ca29085","resolution":{"observed_at":"2026-05-18T18:11:42.887285Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":"2401.06066","doi":"10.48550/arxiv.2401.06066","metadata_source":"pith","pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","venue":"cs.CL","work_id":"a9888d6d-bf47-4324-9834-7cc12ac3a78c","year":2024},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:046922b1fdce013c1b948d272c618daeb1215818c45fd3d20c873e71d4aa8050","observation_id":"2a7dfc01-0e6a-4ca9-9ca4-785f1e769d33","resolution":{"observed_at":"2026-05-18T18:11:42.919002Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M 3vit: Mixture-of-experts vision transformer for effi- cient multi-task learning with model-accelerator co-design","venue":null,"work_id":"aab37324-810b-45eb-8bb4-4a2fff3e8039","year":2022},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:d3abc505b94e47cc1bd29d1249258aa4f9e76c56ba97d96191ba19178d6b764e","observation_id":"edbba3b4-48f2-40fa-b0f5-c80db58927d8","resolution":{"observed_at":"2026-05-18T18:12:47.126760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Speechmoe: Scaling to large acoustic models with dynamic routing mixture of experts","venue":null,"work_id":"54f660e8-6a3d-44b6-b5b3-4e4c67152a5f","year":2021},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:8b169a3e9722fc01456ee6b7509c4b6f542ce03810c9f49a7f7271302de363b9","observation_id":"e7531a26-d10b-4f33-9052-ff6de19da816","resolution":{"observed_at":"2026-05-18T18:12:47.033578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Speechmoe2: Mixture-of-experts model with improved routing","venue":null,"work_id":"f9da849f-5770-477a-abc7-eaf9cfdaf13c","year":2022},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:b497c7d2b49e70fb86e27d7e52ac27384b807ce324636838088da83cf3e6b349","observation_id":"082b8412-2658-4692-87c3-b099c80bf8bc","resolution":{"observed_at":"2026-05-18T18:12:46.983639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language-routing mixture of experts for multilingual and code-switching speech recognition","venue":null,"work_id":"caf342a2-1ccf-406c-ae4c-f32d7297f91b","year":2023},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:573e105b99c010272a4ad06e188c1c16e72a51958a327f28d8705e7ef5376a72","observation_id":"9eacf349-c73a-4994-85e1-b96f62f2099f","resolution":{"observed_at":"2026-05-18T18:12:46.986921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mixture-of-expert conformer for streaming multilingual asr","venue":null,"work_id":"899d726c-d143-4202-b5ac-c86c6bcbe411","year":2023},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:c87ed0424a7995879409b1982cf042486c3bea662d4b5e5b798fd04c6f26f3e1","observation_id":"9b194510-2df0-40c4-b1cb-c89a035db577","resolution":{"observed_at":"2026-05-18T18:12:46.996596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attentive statistics pooling for deep speaker embedding","venue":null,"work_id":"095fa1a4-9849-4568-86d1-6ec4d2477e42","year":2018},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:d774a22619385c7b28c171804278405133f1f3ebeb32aa7af4a7892f8076141e","observation_id":"7e0fbd40-f912-4b73-ab5d-6d201f5ff4d0","resolution":{"observed_at":"2026-05-18T18:12:47.002894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Boosting objective scores of a speech enhancement model by metricgan post-processing","venue":null,"work_id":"c77a30f7-ca60-4851-93ce-550a50114285","year":2020},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:d8504e349a8b450e6bfddfab6c5b7a0c19fc87d152408d8cb7b55c935efe7b31","observation_id":"7afc4812-114f-47c9-acfe-61bc2e3e451f","resolution":{"observed_at":"2026-05-18T18:12:46.976047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gating Neural Network for Large V ocabulary Audiovisual Speech Recognition","venue":null,"work_id":"2a490447-3468-4a3f-928d-24857ab74aac","year":2018},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:d2f5298b7908feecbe1207ef08db19747e08ba100dec6f9203d731aa218d832d","observation_id":"7f5cb555-12f4-450a-a546-4541b6932800","resolution":{"observed_at":"2026-05-18T18:12:46.968485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Freesound datasets: a platform for the creation of open audio datasets","venue":null,"work_id":"106d2fd2-71c4-4896-8759-f31e2a3fa7dd","year":2017},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:87526d88a71a81271e0215f42f83399be0f49cd7eaa48be7e8df53e608fd2c16","observation_id":"d3104929-53d9-480c-b40c-ed937f4338c5","resolution":{"observed_at":"2026-05-18T18:12:47.011414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T17:22:42.658151Z","title":"Icassp 2023 deep noise suppression challenge","venue":null,"work_id":"48686152-c274-439b-9b30-9201701d0f2e","year":2023},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:3655ad9e358e99a45d8a6ef04e8dcfbdce593b7c7556cc80387e97ea864a5324","observation_id":"221de578-63bd-4adf-be73-0f37f763b8e1","resolution":{"observed_at":"2026-05-18T18:12:47.019347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Investi- gating RNN-based speech enhancement methods for noise-robust Text- to-Speech","venue":null,"work_id":"b5970db9-8a86-416d-88ad-d5c0f1acea32","year":2016},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:79ef833a0a151dbde3865a2d5769c32ccb57647e740d8c794f49389421f67ddf","observation_id":"1c27f225-3d57-4d33-9e9f-d396ff5e729f","resolution":{"observed_at":"2026-05-18T18:12:46.969557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":"1701.06538","doi":"10.48550/arxiv.1701.06538","metadata_source":"pith","pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","venue":"cs.LG","work_id":"2c6b3f6d-54e4-4df7-baa7-475a490799af","year":2017},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:40181b8c1d3935c2455f9530311f4846c72cf37e77638b72146084fac9296d70","observation_id":"57db2ad5-b386-4334-bbc9-74599c88454c","resolution":{"observed_at":"2026-05-18T18:11:42.938020Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:24.174744+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:24.174744+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T10:47:02.735397Z","title":"Mod-squad: Designing mixtures of experts as modular multi-task learners","venue":null,"work_id":"3158ff91-4d4f-4cbc-aad7-bc34474a9a24","year":2023},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:f4b16f6a4da24e910dc9ff06d36aaef3734a203729ff10bbd3434e7c56e9eea1","observation_id":"1871874c-6f9f-4a0b-b458-851a766b8823","resolution":{"observed_at":"2026-05-18T18:12:46.993539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition"},"reference_resolution":{"displayed":79,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":0,"verified_exact":10,"verified_fuzzy":66},"total_outbound_references":79},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 79 of 79 outbound references and 0 inbound Pith citation observations for arXiv:2509.08470."}