{"as_of":"2026-08-20T05:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:abc2366c3352594669a46e3ab86fb880cc51ff3fa28cf48c86aa9798b22aaa48","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T23:17:22.404354Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.20707/citation-record","integrity":"/paper/2412.20707/integrity","json":"/paper/2412.20707/citation-record.json","paper":"/paper/2412.20707"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:17:23.230579Z","title":"A multilingual framework based on pre-training model for speech emotion recognition,","venue":null,"work_id":"7d5222eb-a913-4f39-b539-3bd4ab221524","year":2021},"citing_paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T23:17:22.214287Z"},"links":{"citing_paper":"/paper/2412.20707"},"observation_digest":"sha256:48ffb1905fef477fe9d1dcf4affed5ef48b734fa6d61f5bdc5423745f6ba9de2","observation_id":"7e4890a5-752f-4351-86bb-1063ac2411dc","resolution":{"observed_at":"2026-08-10T23:17:23.236730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:17:23.210106Z","title":"Speech emotion recognition using self-supervised features,","venue":null,"work_id":"86ed795f-4eb4-4d50-a267-efb89224824b","year":2022},"citing_paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T23:17:22.220243Z"},"links":{"citing_paper":"/paper/2412.20707"},"observation_digest":"sha256:238a688b74f1c7b000c5dce1422c7cc2c6f74a77da0bb87727f083619a618f58","observation_id":"7a8dd181-99c8-48f1-b14e-9c642ed57327","resolution":{"observed_at":"2026-08-10T23:17:23.216513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08974","last_updated":"2022-02-16T00:23:42Z","snapshot_observed_at":"2026-08-17T11:34:57.545610Z","submitted_at":"2022-02-16T00:23:42Z","title":"Multimodal Emotion Recognition using Transfer Learning from Speaker Recognition and BERT-based models","version":1},"cited_work":{"arxiv_id":"2202.08974","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.08974","snapshot_observed_at":"2026-08-10T23:17:22.494132Z","title":"Multimodal Emotion Recognition using Transfer Learning from Speaker Recognition and BERT-based models","venue":"cs.SD","work_id":"f128a659-c711-4fca-847d-97266f00bab7","year":2022},"citing_paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T23:17:22.225885Z"},"links":{"cited_paper":"/paper/2202.08974","citing_paper":"/paper/2412.20707"},"observation_digest":"sha256:0678f811e51a576ec7addacad371bf1c8648efac7aa6d041dff95ce5cfe4353a","observation_id":"0f0fbd59-fd4f-4a89-9376-7e87bb499867","resolution":{"observed_at":"2026-08-10T23:17:22.500873Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:17:23.188394Z","title":"Two-stage finetuning of wav2vec 2.0 for speech emotion recognition with ASR and gender pretraining,","venue":null,"work_id":"40f6faec-c14c-4f8a-a9d2-c82b08c6595d","year":2023},"citing_paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T23:17:22.231782Z"},"links":{"citing_paper":"/paper/2412.20707"},"observation_digest":"sha256:74042f83830c8fb7a94d168b5fd40636750d6bf2f9ea6ccd536e76c28100eb38","observation_id":"79fdec54-7ebf-4b23-bcb9-c73f79528433","resolution":{"observed_at":"2026-08-10T23:17:23.195810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:17:23.160874Z","title":"A critical review of state-of-the- art chatbot designs and applications,","venue":null,"work_id":"889a1bc8-a6bd-4497-a0af-391efb03bfd3","year":2022},"citing_paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T23:17:22.237201Z"},"links":{"citing_paper":"/paper/2412.20707"},"observation_digest":"sha256:b136b90c31a764844d9d1b37755f37be62c98836cd1c8b2d886486fa87bebaf5","observation_id":"6dbf03d7-0821-497e-abc5-a7c3cc6292a3","resolution":{"observed_at":"2026-08-10T23:17:23.168237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:17:23.140007Z","title":"5IDER: Unified query rewriting for steering, intent carryover, disfluencies, entity carryover and repair,","venue":null,"work_id":"bd53a000-6767-4a0a-8a90-2125420906a5","year":2023},"citing_paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T23:17:22.242770Z"},"links":{"citing_paper":"/paper/2412.20707"},"observation_digest":"sha256:58dd3ba5bc776db4b65fadec573587a7df27f01807d862f1da02de0a037589b5","observation_id":"710fe9a4-5f3d-4d00-b5c2-de1b00e836b6","resolution":{"observed_at":"2026-08-10T23:17:23.145921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:17:23.117599Z","title":"Cross- lingual/cross-channel intent detection in contact-center conversations,","venue":null,"work_id":"dde86aa1-43d9-4db9-9254-cb39a9e68885","year":2023},"citing_paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T23:17:22.248415Z"},"links":{"citing_paper":"/paper/2412.20707"},"observation_digest":"sha256:02b0041251916cf0968ee1e11f6ea63662dce26b6128af1cc04423b94c2e5c14","observation_id":"07df7389-5682-4096-8ac9-ba6e29496c3b","resolution":{"observed_at":"2026-08-10T23:17:23.125229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:17:23.098515Z","title":"Automated neural nursing assistant (ANNA): An over-the-phone system for cogni- tive monitoring,","venue":null,"work_id":"51842892-9e1e-40d9-a407-da9567373483","year":2023},"citing_paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T23:17:22.253302Z"},"links":{"citing_paper":"/paper/2412.20707"},"observation_digest":"sha256:18541c0c35a3fef3ef7bf6980630bb2b7e17f1d8dab6f6c52668f8317a945872","observation_id":"256dc594-4132-4e5b-8010-d8b773311bc8","resolution":{"observed_at":"2026-08-10T23:17:23.104554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:17:23.079416Z","title":"Whisper-based transfer learning for alzheimer disease classification: Leveraging speech segments with full transcripts as prompts,","venue":null,"work_id":"a2d83d68-9d8f-417c-bad2-16caebf5921a","year":2024},"citing_paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T23:17:22.258651Z"},"links":{"citing_paper":"/paper/2412.20707"},"observation_digest":"sha256:5dd8e69655610ef9b5f37d4d86b0d50fe87ae050cc4b3e28dd3836859f843e50","observation_id":"b93b4a2d-fa71-4f20-8695-dbeb479022a6","resolution":{"observed_at":"2026-08-10T23:17:23.085668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:17:23.056021Z","title":"Cross-lingual alzheimer’s disease detection based on paralinguistic and pre-trained features,","venue":null,"work_id":"50e52c0e-19cd-4ed5-ba94-5216b9afd6f5","year":2023},"citing_paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T23:17:22.263723Z"},"links":{"citing_paper":"/paper/2412.20707"},"observation_digest":"sha256:133aab4faa7977c5a5181c67641cd0a5eabfaea6df7b5bafd19e2debd0a1c0e5","observation_id":"8985799d-a91e-4e82-b842-9c51ebce62b9","resolution":{"observed_at":"2026-08-10T23:17:23.063241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:17:23.030509Z","title":"Exploiting emotion information in speaker embeddings for expressive text-to-speech,","venue":null,"work_id":"7d8eeb7f-7d95-4296-8322-3c0c599df200","year":2023},"citing_paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T23:17:22.268653Z"},"links":{"citing_paper":"/paper/2412.20707"},"observation_digest":"sha256:f77e712e18d154747b7576797a39c2cad05d1aab0afcdeb183f97414c5ed5643","observation_id":"3a9f7c62-16b3-470f-a5d0-0001e400133e","resolution":{"observed_at":"2026-08-10T23:17:23.040858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:17:23.009228Z","title":"Fusing ASR outputs in joint training for speech emotion recognition,","venue":null,"work_id":"14046945-f2ac-411c-a1eb-d6583f691947","year":2022},"citing_paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T23:17:22.273899Z"},"links":{"citing_paper":"/paper/2412.20707"},"observation_digest":"sha256:3468082050a471d19db6281408d3be765db9c491ad8bd468a74bf76bded6276d","observation_id":"b53dbe3c-341f-4a2d-8fd5-7bdff34ad2b0","resolution":{"observed_at":"2026-08-10T23:17:23.016350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:17:22.988840Z","title":"Speaker-aware training of speech emotion classifier with speaker recognition,","venue":null,"work_id":"ea0f928a-5070-4a81-94e4-78284c6b87f1","year":2021},"citing_paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T23:17:22.278978Z"},"links":{"citing_paper":"/paper/2412.20707"},"observation_digest":"sha256:a65d9a72bb5dda0470f897bf3272412b84e62170d64756c59dcadd3146d164cb","observation_id":"dbc7a5f6-9e06-4bad-aa56-096815562573","resolution":{"observed_at":"2026-08-10T23:17:22.994690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:17:22.970243Z","title":"Speech emotion recognition combining acoustic features and linguistic information in a hybrid support vector machine-belief network architecture,","venue":null,"work_id":"8e07f98f-1b2b-4195-ac25-d3715b0939b0","year":2004},"citing_paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T23:17:22.283316Z"},"links":{"citing_paper":"/paper/2412.20707"},"observation_digest":"sha256:4a18fd17ccbd52c7736c3171cfd00463dd9e080c72f668fab97ddb2c16ee94fe","observation_id":"033dcf7b-d786-4ddf-95ec-adb14de1245d","resolution":{"observed_at":"2026-08-10T23:17:22.976220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:17:22.948734Z","title":"Mmer: Multimodal multi-task learning for speech emotion recognition,","venue":null,"work_id":"87072269-d0bb-4b78-88fc-f1b0b28a85d6","year":2023},"citing_paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T23:17:22.288098Z"},"links":{"citing_paper":"/paper/2412.20707"},"observation_digest":"sha256:5d13da3b157c26da9af044a15f17baaae7fad30c8a0105b1de8dbe57e7022d63","observation_id":"9624075a-b886-457c-8280-683a005e5be0","resolution":{"observed_at":"2026-08-10T23:17:22.955535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:17:22.925622Z","title":"Speech emotion recognition using decomposed speech via multi-task learning,","venue":null,"work_id":"e768bbdd-591a-47f2-a809-eea6c589845b","year":2023},"citing_paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T23:17:22.292405Z"},"links":{"citing_paper":"/paper/2412.20707"},"observation_digest":"sha256:9a5fa7e56908160028f99eb9b7ee93c062f8c56bbebee3f920748cc0bfe26912","observation_id":"6e475d38-d491-4e50-84f0-7a1bd40f4e49","resolution":{"observed_at":"2026-08-10T23:17:22.931812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:17:22.906107Z","title":"Multi-task learning based end-to-end speaker recognition,","venue":null,"work_id":"6afadbef-2fd5-4002-b8ca-210c5e668261","year":2019},"citing_paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T23:17:22.297144Z"},"links":{"citing_paper":"/paper/2412.20707"},"observation_digest":"sha256:b3c79ab1a707fe4176fb7e8b15a7b3b4217549423527d57c286d90647a9d84e5","observation_id":"370fad4d-56e1-4f10-bb79-27d6e2e5ccbf","resolution":{"observed_at":"2026-08-10T23:17:22.912334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:17:22.885161Z","title":"Mutitask learning based muti-examples keywords spotting in low resource condition,","venue":null,"work_id":"d103ce2b-a8cf-4a41-a061-fe83362d7442","year":2018},"citing_paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T23:17:22.301649Z"},"links":{"citing_paper":"/paper/2412.20707"},"observation_digest":"sha256:6b98db7505a12c01920184d8a368859ab26f1bc2d102779ebdb2cdc359405f8d","observation_id":"029539ea-7a8b-4d82-9485-fbc6fc9dfa7d","resolution":{"observed_at":"2026-08-10T23:17:22.892600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:17:22.863440Z","title":"MMER: Multimodal multi-task learning for speech emotion recogni- tion,","venue":null,"work_id":"f45ce56f-3152-4d5a-bb27-093f7930c231","year":2023},"citing_paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T23:17:22.305904Z"},"links":{"citing_paper":"/paper/2412.20707"},"observation_digest":"sha256:bc45be21e44831ca0e3bef692c63b869f4b3a9cfb30a7e687c65f3d2bb37ed86","observation_id":"692e9aec-eb37-4f04-87f7-149c263a8c96","resolution":{"observed_at":"2026-08-10T23:17:22.869114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:17:22.843328Z","title":"A review of speech emotion recognition: Datasets, features, and machine learning algorithms,","venue":null,"work_id":"f83f2fcc-09b9-4014-a573-06ebd8d82756","year":2020},"citing_paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T23:17:22.310575Z"},"links":{"citing_paper":"/paper/2412.20707"},"observation_digest":"sha256:270d2010b3943726f1702ebc72933648a778d5f24bb8e19b853e0f0fdf759c50","observation_id":"c8a87b47-d21e-4ce1-9a57-baac1f7080d0","resolution":{"observed_at":"2026-08-10T23:17:22.849947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:17:22.822988Z","title":"Gra- dient surgery for multi-task learning,","venue":null,"work_id":"9f34f021-2275-4978-b571-0d6a51180e42","year":2020},"citing_paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T23:17:22.315120Z"},"links":{"citing_paper":"/paper/2412.20707"},"observation_digest":"sha256:09c1b82c5069e084b969bd533742c67002d6cd7e0b3e684f6ccff6539c618cef","observation_id":"a4398042-aed0-456f-9c08-9d63cb487125","resolution":{"observed_at":"2026-08-10T23:17:22.828679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.01126","last_updated":"2020-07-02T14:23:39Z","snapshot_observed_at":"2026-08-15T18:06:15.365582Z","submitted_at":"2020-07-02T14:23:39Z","title":"A Brief Review of Deep Multi-task Learning and Auxiliary Task Learning","version":1},"cited_work":{"arxiv_id":"2007.01126","doi":null,"metadata_source":"pith","pith_arxiv_id":"2007.01126","snapshot_observed_at":"2026-08-10T23:17:22.465218Z","title":"A Brief Review of Deep Multi-task Learning and Auxiliary Task Learning","venue":"cs.LG","work_id":"fff4d9f7-eb7c-454a-9283-7fedf0a89ba2","year":2020},"citing_paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T23:17:22.320384Z"},"links":{"cited_paper":"/paper/2007.01126","citing_paper":"/paper/2412.20707"},"observation_digest":"sha256:1820f247685dce78a105af0671c80814e69cba5bd1215a85abaec10660bad2b1","observation_id":"50eb2c70-50a2-437c-b745-c271dadcd72c","resolution":{"observed_at":"2026-08-10T23:17:22.473148Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:17:22.805107Z","title":"Exploring large scale pre-trained models for robust machine anomalous sound detection,","venue":null,"work_id":"efa5a603-5b48-4157-a8d4-44335d303213","year":2024},"citing_paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T23:17:22.325674Z"},"links":{"citing_paper":"/paper/2412.20707"},"observation_digest":"sha256:14a61fe0eff6397f08c439e356af931be6885bddd9d78a5bd2b84bbaa06e904a","observation_id":"b3e33fbf-3f5f-43fb-8183-7085f5148971","resolution":{"observed_at":"2026-08-10T23:17:22.811053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:17:22.786093Z","title":"Ef- ficient multi-task auxiliary learning: Selecting auxiliary data by feature similarity,","venue":null,"work_id":"545efdc5-946e-4e75-a1d9-3507038014ce","year":2021},"citing_paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T23:17:22.330852Z"},"links":{"citing_paper":"/paper/2412.20707"},"observation_digest":"sha256:4024fc2972f3e21cc83504b01a457796f32153cef5241d5be2829d1fd080babf","observation_id":"6b178ba7-f6d3-4aee-8c32-56a30ee016dd","resolution":{"observed_at":"2026-08-10T23:17:22.792409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:17:22.766549Z","title":"Towards discriminative representations and unbiased predictions: Class-specific angular softmax for speech emotion recognition","venue":null,"work_id":"05241821-2fc5-4610-b6a1-da0cb6fe4a34","year":2019},"citing_paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T23:17:22.336168Z"},"links":{"citing_paper":"/paper/2412.20707"},"observation_digest":"sha256:1c34a964883127624db6b41c451ff5ec4b35e8927aabcf71ff56dfb67684b25b","observation_id":"cd313358-5553-4dad-b853-c26c2a1b9c43","resolution":{"observed_at":"2026-08-10T23:17:22.772343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:17:22.744526Z","title":"HuBERT: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":"b32b50a9-af9d-4c1c-ad6d-0c4ca65fb16e","year":2021},"citing_paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T23:17:22.341020Z"},"links":{"citing_paper":"/paper/2412.20707"},"observation_digest":"sha256:d84375b9913dbec3cd7ac2647bab2ccc5bc364c7221fdc8f14b5bce772c55698","observation_id":"abb88b1c-2745-4d6e-a0cf-9712a643f370","resolution":{"observed_at":"2026-08-10T23:17:22.752145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:17:22.346074Z","title":"WavLM: Large-scale self-supervised pre- training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T23:17:22.346074Z"},"links":{"citing_paper":"/paper/2412.20707"},"observation_digest":"sha256:94d6124c8ecaf8b60dedfccd267048804c4f8a76e8bd0e2e8cb2d3a92b602cb7","observation_id":"1b776ba8-d3fd-4fbe-8d87-9717ece76e1e","resolution":{"observed_at":"2026-08-10T23:17:22.346074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:17:22.706765Z","title":"Connectionist temporal classification: labelling unsegmented sequence data with re- current neural networks,","venue":null,"work_id":"6a34e569-eec9-4b2d-8be6-c9783267c956","year":2006},"citing_paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T23:17:22.350923Z"},"links":{"citing_paper":"/paper/2412.20707"},"observation_digest":"sha256:14db52f6243eaf714d5a915fe270c46cc7f7f4e31cc6ea516e51ace1d3570d49","observation_id":"b18588ce-ea09-4d63-be53-4c8701ac5d8c","resolution":{"observed_at":"2026-08-10T23:17:22.713652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:17:22.688349Z","title":"IEMOCAP: Interactive emotional dyadic motion capture database,","venue":null,"work_id":"ec957c75-1071-467a-9258-6d6e4004f275","year":2008},"citing_paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T23:17:22.355879Z"},"links":{"citing_paper":"/paper/2412.20707"},"observation_digest":"sha256:60613b761faea3309b1d990e2e0f2786d79eb7d276ebfa054456559730b86c4f","observation_id":"cccd2cc8-763b-49c1-9b5d-7c8e048f58c7","resolution":{"observed_at":"2026-08-10T23:17:22.694026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:17:22.665537Z","title":"Mingling or misalignment? temporal shift for speech emotion recognition with pre-trained representations,","venue":null,"work_id":"f4563473-2bd5-4a98-af94-f834dbfe6205","year":2023},"citing_paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T23:17:22.360783Z"},"links":{"citing_paper":"/paper/2412.20707"},"observation_digest":"sha256:7fa33831fa485ee7d751b2ad958a114869e0461679c0f5f485c2678bd14ed1d1","observation_id":"e37e29a3-5858-466d-a04a-79493be0a9d4","resolution":{"observed_at":"2026-08-10T23:17:22.672207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:17:22.645991Z","title":"Temporal modeling matters: A novel temporal emotional modeling approach for speech emotion recognition,","venue":null,"work_id":"992127c8-7809-4e51-9a3d-189e9abc32cf","year":2023},"citing_paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T23:17:22.365523Z"},"links":{"citing_paper":"/paper/2412.20707"},"observation_digest":"sha256:1c073bbacec87aab67f3d4d84b9a1e616b0dafaa0d0e0b6b6003ed5a4200051a","observation_id":"30a51ffa-d905-4a99-84e0-b44b1a954969","resolution":{"observed_at":"2026-08-10T23:17:22.651732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:17:22.625800Z","title":"DST: Deformable speech transformer for emotion recognition,","venue":null,"work_id":"86b2bd84-110e-4227-81c0-0db9f0836ca2","year":2023},"citing_paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T23:17:22.370421Z"},"links":{"citing_paper":"/paper/2412.20707"},"observation_digest":"sha256:0a32e0cc8fccb94a67a9960ba64e364c2ef4001edeb819f42e9b92fb90cd2811","observation_id":"d32ad3da-e89f-49a6-9041-82bc06da6272","resolution":{"observed_at":"2026-08-10T23:17:22.632156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:17:22.600304Z","title":"DWFormer: Dynamic window transformer for speech emotion recognition,","venue":null,"work_id":"b24d176b-38ec-4e54-800a-1d750658bb19","year":2023},"citing_paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T23:17:22.375867Z"},"links":{"citing_paper":"/paper/2412.20707"},"observation_digest":"sha256:5dc7bf597ebe8700f1c590661581e466ec067f0e4b821ce6b23947767dd4f268","observation_id":"e909e910-155c-4bfc-86ff-9e951f380b52","resolution":{"observed_at":"2026-08-10T23:17:22.606479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:17:22.578794Z","title":"Multiple acoustic features speech emotion recognition using cross-attention transformer,","venue":null,"work_id":"6317f4c8-f100-46b6-959d-fd113b4cf5d5","year":2023},"citing_paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T23:17:22.380966Z"},"links":{"citing_paper":"/paper/2412.20707"},"observation_digest":"sha256:0cb6b1f518309d69d52311385838728e857a66217ad999c521f160485dbd6f20","observation_id":"e96bf5fa-1564-44b2-bfa4-405c7d08e299","resolution":{"observed_at":"2026-08-10T23:17:22.585148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:17:22.555454Z","title":"PyTorch: An imperative style, high-performance deep learning library,","venue":null,"work_id":"0e1012e0-b056-42ed-9f7e-b46bb0c33127","year":2019},"citing_paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T23:17:22.385801Z"},"links":{"citing_paper":"/paper/2412.20707"},"observation_digest":"sha256:c95c7c2c2846caf24e81e1db19be1936d408fb2fb7864b1c61332581d019245c","observation_id":"70ad94d0-280f-49f8-bb53-8246e3f93987","resolution":{"observed_at":"2026-08-10T23:17:22.562507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-18T17:51:41.801692Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-08-10T23:17:22.392521Z","title":"SpeechBrain: A general-purpose speech toolkit,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T23:17:22.392521Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2412.20707"},"observation_digest":"sha256:e0217fb01db4084b1dae0369d80fba6c2890fffe881f1b0a057835bd8a7e8889","observation_id":"f49a7b98-3f6d-4ddc-a411-d9134287950a","resolution":{"observed_at":"2026-08-10T23:17:22.392521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:17:22.399386Z","title":"Improving automatic speech recognition performance for low-resource languages with self-supervised models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T23:17:22.399386Z"},"links":{"citing_paper":"/paper/2412.20707"},"observation_digest":"sha256:17b2d8438f9fab2b2d4dba253d3a6efb48c91efab7522146f71394d721fd5e5c","observation_id":"04aa0dd0-e364-402f-8a16-fa1fe7d14b07","resolution":{"observed_at":"2026-08-10T23:17:22.399386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:17:22.514160Z","title":"Librispeech: an ASR corpus based on public domain audio books,","venue":null,"work_id":"2ea1dd61-a47f-4029-a812-10b59e60a80e","year":2015},"citing_paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T23:17:22.404354Z"},"links":{"citing_paper":"/paper/2412.20707"},"observation_digest":"sha256:97f6cdc0c6dc03d5c2964cef448b0e39f19805cb93253b7856065e60dace0bf4","observation_id":"7640c6a6-a954-4852-8296-f323df04bd98","resolution":{"observed_at":"2026-08-10T23:17:22.522365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.20707","last_updated":"2024-12-30T04:49:43Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-17T14:14:13.403433Z","submitted_at":"2024-12-30T04:49:43Z","title":"Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":2,"verified_fuzzy":33},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2412.20707."}