{"as_of":"2026-08-11T17:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d131f34b5ed00da22e54b27547844c668977e741b4e58a41a41fe824f22ed1c4","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:03:46.423506Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.10408/citation-record","integrity":"/paper/2501.10408/integrity","json":"/paper/2501.10408/citation-record.json","paper":"/paper/2501.10408"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.158505Z","title":"Survey on speech emotion recognition: Features, classification schemes, and databases,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.158505Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:142ec5891cadbf6eae688ea1bd4fae74237fb0a2081eee62f1c7b7e9fb0d4f48","observation_id":"5d9f458a-2b9d-42e0-97c9-c9e1efbf47d0","resolution":{"observed_at":"2026-08-10T22:03:46.158505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:47.230590Z","title":"Automated screening for distress: A perspective for the future,","venue":null,"work_id":"93ed2fe1-2762-4aad-a97f-c95c9d560333","year":2019},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.163148Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:16c41d41706ac6658ecb5ddfc36fbf68eb714ab8609f86758547a47314348856","observation_id":"7fcfe993-29b8-4819-9a9d-b516735e2180","resolution":{"observed_at":"2026-08-10T22:03:47.235024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:47.217450Z","title":"A comprehensive review of speech emotion recognition systems,","venue":null,"work_id":"5fcb75fc-6fb2-4374-a2ff-68eb3a05ca95","year":2021},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.167285Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:ab05c3edba545460ba06cc7c8ed2fa7f76f559bf65aeaa55e5a561ce361f0245","observation_id":"2136bb00-d04d-4c7c-8408-55edfd3d2f94","resolution":{"observed_at":"2026-08-10T22:03:47.222037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:47.204397Z","title":"A systematic review on affective computing: Emotion models, databases, and recent advances,","venue":null,"work_id":"621a9948-7ccd-4c29-b34b-4c0837e49db7","year":2022},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.171506Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:e8df4435baca4fcc6cca7e630e9fdc13f0bac04717e93fc9634c1da68d38ce1e","observation_id":"6bfd99bb-f33e-4e79-b448-8ddcb0ce83e9","resolution":{"observed_at":"2026-08-10T22:03:47.208815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:47.191896Z","title":"Speech emotion recognition based on hmm and svm,","venue":null,"work_id":"455ae75d-8316-4a7e-89ec-c0bdc5e2cb15","year":2005},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.175572Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:d7eeb625f2257e8dc7fddddde95de5e4509977fe1f7c8166053c020e3d799e09","observation_id":"f4bdc4c7-2d10-403c-aced-091b912dd74e","resolution":{"observed_at":"2026-08-10T22:03:47.196125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:47.179442Z","title":"Speech emotion recognition using fourier parameters,","venue":null,"work_id":"8c360479-34d4-40f0-b13a-d19b2be040cf","year":2015},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.179384Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:072f0abce5b0ca4ebe7bc42859392ab080d21b8c2d39b7be9070290607fb7b36","observation_id":"8e9a929a-100d-4543-a310-aea698f690b2","resolution":{"observed_at":"2026-08-10T22:03:47.183388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:47.167514Z","title":"Implementation and comparison of speech emotion recognition system using gaussian mix- ture model (gmm) and k-nearest neighbor K-NN techniques,","venue":null,"work_id":"d89e7aa9-cf5d-44db-953a-7089cf1b717a","year":2015},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.183781Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:9c2aa26bb61395afcd5fab680ed135075573d451fdb103335de4ef388d30b801","observation_id":"cafb2ea4-c30f-4b5d-804b-71580730622a","resolution":{"observed_at":"2026-08-10T22:03:47.171983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.187538Z","title":"Speech emotion recognition using deep learning techniques: A review,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.187538Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:0ffa2d80b99a2764a357f773c83e9c5b58b97c1fa07f194b2ce8abe1eb0b0e79","observation_id":"53bd97bb-f986-429d-bb1e-b3e633253f65","resolution":{"observed_at":"2026-08-10T22:03:46.187538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:47.147746Z","title":"Deep learning approaches for speech emotion recognition: State of the art and research challenges,","venue":null,"work_id":"b381e4bc-b165-49eb-92d6-433f564f43d2","year":2021},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.191149Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:0aedd165a0fd735cc0ae03c04ad3dc4dd8f68c339e1e58c65ade8c94c026e13d","observation_id":"eba3a012-aedf-4141-aac3-2c045f8600fa","resolution":{"observed_at":"2026-08-10T22:03:47.151911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:47.136141Z","title":"Speech emotion recognition: A review,","venue":null,"work_id":"43ec71ef-32a8-4ff8-a1fd-949458b27602","year":2019},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.194664Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:f98189e4d5aabdb9b7e95d293cd2b0d995f39c255469cffd34fb96f88a22d6f9","observation_id":"10111b15-b7e0-4516-a1bb-3847a9d1bf30","resolution":{"observed_at":"2026-08-10T22:03:47.140142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:47.125401Z","title":"Self-supervised speech representation learning: A review,","venue":null,"work_id":"c9577b2c-f5cd-48e1-a86b-8425ba16951a","year":2022},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.198403Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:f508d3fcdf39282d90284820b8516b8efd661e49eaa561af8a5ec47d4cc6d3f7","observation_id":"7ca597b3-62f9-495e-a587-5efba9288d31","resolution":{"observed_at":"2026-08-10T22:03:47.129132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:47.114316Z","title":"Cross-corpus speech emotion recognition using semi-supervised transfer non-negative matrix factorization with adapta- tion regularization","venue":null,"work_id":"cd738f8d-718a-47e8-9619-15a5a38ec8b7","year":2019},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.202037Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:9ec13884cd39c3500ffaa24766e6eb13f4030b98f3a628ff713eac5fec2f7d03","observation_id":"54ea93b7-b461-4e08-ac93-dcf46326a465","resolution":{"observed_at":"2026-08-10T22:03:47.117859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:47.104060Z","title":"Multisource i-vectors domain adaptation using maximum mean discrepancy based autoencoders,","venue":null,"work_id":"94d6b43e-36f5-44fb-a819-c39bc0d70343","year":2018},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.205681Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:7216ecbea7b0cb490189a973687751d1df11429df7468430fa223f3191785118","observation_id":"5aafa406-d37a-4a45-b8ff-02121f1d7764","resolution":{"observed_at":"2026-08-10T22:03:47.107450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.209137Z","title":"Self-supervised learning for multimedia recommendation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.209137Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:d48d2bbca15143897ee7cfd77d0c501bbc0f8de447358e37a7bfe838ec1caf4b","observation_id":"6004547b-3651-4129-b6c9-89687eefa887","resolution":{"observed_at":"2026-08-10T22:03:46.209137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:47.085354Z","title":"V oicepm: A robust privacy measurement on voice anonymity,","venue":null,"work_id":"f607f866-4e36-46b2-a9e0-15c2304880d1","year":2023},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.212888Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:427484f3d36469a0f36963778c5a95d063f5ff737b86b7fbfa3c66f0c7d5059f","observation_id":"f35da031-9485-42b1-8e35-3962b573b406","resolution":{"observed_at":"2026-08-10T22:03:47.089422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07162","last_updated":"2024-06-11T11:12:51Z","snapshot_observed_at":"2026-08-06T08:12:49.540745Z","submitted_at":"2024-06-11T11:12:51Z","title":"EmoBox: Multilingual Multi-corpus Speech Emotion Recognition Toolkit and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07162","snapshot_observed_at":"2026-08-10T22:03:46.216697Z","title":"Emobox: Multilingual multi-corpus speech emotion recog- nition toolkit and benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.216697Z"},"links":{"cited_paper":"/paper/2406.07162","citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:80a730fb505ff311a934012f256d86d90c2a8bc51c7e7da1ec68ce34c9df9da2","observation_id":"9b40a672-56f6-44db-bbc9-79e3aa93cda2","resolution":{"observed_at":"2026-08-10T22:03:46.216697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:47.073908Z","title":"Distilhubert: Speech rep- resentation learning by layer-wise distillation of hidden-unit bert,","venue":null,"work_id":"beae2a32-4fc5-48a0-bb61-46e560b988dd","year":2022},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.221057Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:269c6fa0ffd6a68a2503eecb3f0136af9f0f60abaa39db99e24ab9bc6bc44a34","observation_id":"93248707-0b57-4517-b528-d7068f787745","resolution":{"observed_at":"2026-08-10T22:03:47.078403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:47.050897Z","title":"Cross- corpus speech emotion recognition with hubert self-supervised represen- tation,","venue":null,"work_id":"d65c8916-9931-49cf-8fd2-f0298f377231","year":2022},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.228550Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:5cd7d722bf4f6bc7ee69f33b3596b93e92c328065dbf14bf8ed0ba9a12327374","observation_id":"400e1269-1d19-4870-beeb-31daa841da73","resolution":{"observed_at":"2026-08-10T22:03:47.054835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:47.028195Z","title":"Representation learning through cross-modal conditional teacher-student training for speech emotion recognition,","venue":null,"work_id":"707de1df-1939-45c4-93d9-f89dc8c2d930","year":2022},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.236144Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:94c0f13b6c449035e74a43d0beb755e7471a28007eb3c822c10afcd4566d41a0","observation_id":"9ca3722d-d12f-4a91-a515-6e85776180bb","resolution":{"observed_at":"2026-08-10T22:03:47.032530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:47.039740Z","title":"Multi-lingual multi-task speech emotion recognition using wav2vec 2.0,","venue":null,"work_id":"cb90ca2d-fcef-402f-a1c9-7405ee604d3f","year":2022},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.239811Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:3fbfb331038ac3de03b90060bd81fc7336d84ed1e0ecdcbc672ceca1d0ce7de0","observation_id":"e9528ff4-ea07-44b5-8e2c-e783a2cdc060","resolution":{"observed_at":"2026-08-10T22:03:47.043852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:47.016626Z","title":"A systematic literature review of speech emotion recognition approaches,","venue":null,"work_id":"e9b7b8b0-efcb-4889-998b-a23faf14f692","year":2022},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.243277Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:8c168d91db7faafb938a1e8fa0d97b877130ddaf0b78d9b40a5e6c498af5d9e3","observation_id":"97025186-4438-4199-ab80-91f3e70e8bf6","resolution":{"observed_at":"2026-08-10T22:03:47.020648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:47.004463Z","title":"Speech emotion recognition using sequential capsule net- works,","venue":null,"work_id":"d360f91f-be0e-4055-ac85-3721c0bf2dd1","year":2021},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.246846Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:dcc1fe5e49ed7554b0de3b88f415cf0e267e36bc52f1221018a5f54e3a1ef223","observation_id":"43f0ceff-e65e-4675-806d-ec65f6e7d3bf","resolution":{"observed_at":"2026-08-10T22:03:47.008668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.992974Z","title":"Transformer based unsupervised pre-training for acoustic representation learning,","venue":null,"work_id":"7ff715de-6007-4b77-a3e7-5bea470c812b","year":2021},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.250373Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:9520b4ff936ed9669e049060349d13598c0bd894f8a58ebbbe67cb427811cf93","observation_id":"f0550e3e-0284-4f9e-958b-b921ddc39129","resolution":{"observed_at":"2026-08-10T22:03:46.996977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.980635Z","title":"Contrastive unsupervised learning for speech emotion recognition,","venue":null,"work_id":"e9ee8c51-dfdf-4ff3-847f-1bc115d007c8","year":2021},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.253761Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:d5f5cad79d58266ffdcf3e6a321bb597284b8e84db3926e85b321aac86a8b530","observation_id":"4b49e13e-484d-49cb-9b74-d3734ff4ceff","resolution":{"observed_at":"2026-08-10T22:03:46.985001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.968787Z","title":"Cross-corpus classification of realistic emotions–some pilot experiments,","venue":null,"work_id":"323def08-0c1a-4af9-bbb1-5f80e8e93562","year":2010},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.256684Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:53cf8435911a3165321f2c5d6752e607b5869142961315a33b119ae97a890d51","observation_id":"343226f7-59e1-4756-ace0-0a571e0216ac","resolution":{"observed_at":"2026-08-10T22:03:46.972663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.958164Z","title":"Using multiple databases for training in emotion recognition: To unite or to vote?","venue":null,"work_id":"63e10901-bcd0-48af-91f9-1724cbb90e2f","year":2011},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.259863Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:9585065fa8e87b32379035fb06537471b02f0bd0ee806294b48c92b56e227ba3","observation_id":"90c716c7-c6bf-4905-94a4-07fe633321bb","resolution":{"observed_at":"2026-08-10T22:03:46.962020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.932767Z","title":"Cross lingual speech emotion recognition: Urdu vs. western languages,","venue":null,"work_id":"3c4a3670-d34e-4659-a724-6bdf8de7e91e","year":2018},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.265679Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:6085acb6b19d600bc43e6d8919b73e23fc883aed8a9f718c5e63af882d02d951","observation_id":"e89833ab-4ca0-44a7-984c-3b6c2cf0ecf0","resolution":{"observed_at":"2026-08-10T22:03:46.937417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.919073Z","title":"A study on cross-corpus speech emotion recognition and data augmenta- tion,","venue":null,"work_id":"371f4ab9-1089-431d-a160-3379b3ce31b6","year":2021},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.268532Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:255155bbb7af5de67b6e9409a141c268f4a58a3635dcb59d50c71e20ba787b8c","observation_id":"0b3c17dd-5112-46e6-a076-36c1360e710b","resolution":{"observed_at":"2026-08-10T22:03:46.923837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.271286Z","title":"Wavlm: Large-scale self-supervised pre- training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.271286Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:06389df872adcbbfa2012c370246bcd7b60ea9ead0dc5cd9bb2ab8edfd0bcb59","observation_id":"f14ac591-040d-4b74-b210-26fa306e9e72","resolution":{"observed_at":"2026-08-10T22:03:46.271286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.03502","last_updated":"2021-04-08T04:31:58Z","snapshot_observed_at":"2026-07-06T10:57:30.968546Z","submitted_at":"2021-04-08T04:31:58Z","title":"Emotion Recognition from Speech Using Wav2vec 2.0 Embeddings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.03502","snapshot_observed_at":"2026-08-10T22:03:46.274112Z","title":"Emotion recognition from speech using wav2vec 2.0 embeddings,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.274112Z"},"links":{"cited_paper":"/paper/2104.03502","citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:d958313699de9669fcbf1168940c70d9433d4f2c20b9a0f911306b0f5bdcd0c2","observation_id":"fa02346d-452d-47ac-91a8-54bdf61fe6c4","resolution":{"observed_at":"2026-08-10T22:03:46.274112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.277544Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.277544Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:851c8e079495c03d054983e95213b5ba4ea9697b8d67df787031a405dec96974","observation_id":"1a3dadf8-57c4-421f-9ee0-4d15698724f0","resolution":{"observed_at":"2026-08-10T22:03:46.277544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-10T22:03:46.280610Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.280610Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:0317100a1b90c4684c0b85f42c7717d0e9db9825f346a3e6512c2c9f386d24a1","observation_id":"c68edca5-7a1a-426c-a7ff-02e20c3b098d","resolution":{"observed_at":"2026-08-10T22:03:46.280610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.889787Z","title":"Unveiling em- bedded features in wav2vec2 and hubert msodels for speech emotion recognition,","venue":null,"work_id":"8e1f1abe-a687-4cc8-a95a-16446b07feaa","year":2024},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.284910Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:e42161211badc3bce35a6297e443d6bc50e50c0bed2ed7e2c0209b645620a4f8","observation_id":"037f3f20-ed5d-4395-84af-fe1224603bdc","resolution":{"observed_at":"2026-08-10T22:03:46.894905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.875860Z","title":"Layer-wise analysis of a self- supervised speech representation model,","venue":null,"work_id":"61dc8238-3f2c-430d-8c5b-b631a406da31","year":2021},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.288780Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:e61e97fcad234a6749ae4c2d19aebc3bd20670a5aa28c28a6e2a20b777453e3d","observation_id":"338da2a7-2f0a-4d57-b961-6368ccf41018","resolution":{"observed_at":"2026-08-10T22:03:46.879795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.863020Z","title":"Multiple acoustic features speech emotion recognition using cross-attention transformer,","venue":null,"work_id":"4ee75979-8948-4598-9fd5-994da84275fc","year":2023},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.292238Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:ecc05bc130ce93e8fe397ffdf0fdd7f5f4a492a3944c2d68c29e62b8696dab61","observation_id":"1fa10ff4-f3f1-48d7-ba42-7b07a6951420","resolution":{"observed_at":"2026-08-10T22:03:46.867830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.849357Z","title":"Speech emotion recognition using local and global features,","venue":null,"work_id":"60755de1-758c-4dcf-aa9f-bd0189e6432d","year":2017},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.295572Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:7078468424cb67d81f8f9b5e24a6750437eb1e71456e5c60eb909e043e133076","observation_id":"f685dcdd-657d-4155-84ac-8a6c61275ade","resolution":{"observed_at":"2026-08-10T22:03:46.854580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.299358Z","title":"Modeling prosodic features with joint factor analysis for speaker verification,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.299358Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:131a2a2f39bad7cd9a69aafc9fd27e33db6d7da2dfd3a968a9437721a67d717f","observation_id":"cb2f5bd9-4d17-4cab-8f74-c2793d99fdaf","resolution":{"observed_at":"2026-08-10T22:03:46.299358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.828730Z","title":"A novel feature selection method for speech emotion recognition,","venue":null,"work_id":"b91d104d-6a56-477b-9810-916486e0cddf","year":2019},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.302957Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:72f71f8f9bb54b8fa28610d1d09e4ce17a3e06dca77c4515e0f7f06a39586caf","observation_id":"d292971c-9eb5-4d50-bf3c-69d234cad1e6","resolution":{"observed_at":"2026-08-10T22:03:46.833622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.815342Z","title":"Analysis of linguistic and prosodic features of bilingual arabic–english speakers for speech emotion recognition,","venue":null,"work_id":"151ac4ff-953e-402e-ba70-d5733c7bb3c4","year":2020},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.306418Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:799b6de981dd33ececfc5961cda86be5d6b00f3f3adac13973b1c64466cb1bfa","observation_id":"dfc004f2-7f58-48e6-89a4-2625872800b5","resolution":{"observed_at":"2026-08-10T22:03:46.819871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.310892Z","title":"Towards an automatic evaluation of the dysarthria level of patients with parkinson’s disease,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.310892Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:21c4e23cadfb312ef2df0a2af74f6b24ee6cb6750eb02c15aa36686c1ff3549f","observation_id":"8af5c4ff-fc55-4de5-b71d-676536114824","resolution":{"observed_at":"2026-08-10T22:03:46.310892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.795094Z","title":"Speech emotion recognition based on multiple acoustic features and deep convolutional neural network,","venue":null,"work_id":"b0760c64-5817-4ef2-9c0a-0706af614493","year":2023},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.314890Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:9ef123b2ff338d5e3825a0e8a3be7487dbe9028bcfddd53e4b8444d6aac5de51","observation_id":"5337d1f6-a749-4037-a1d9-b67e06b47cbd","resolution":{"observed_at":"2026-08-10T22:03:46.799357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.785045Z","title":"Speech emotion recognition using mel frequency log spectrogram and deep convolutional neural network,","venue":null,"work_id":"ddd44a0f-29e0-4551-bcf7-45f49d5833e8","year":2020},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.318695Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:b14500b0ab5d6c3c3c1f214f7a82bdcc2e04374ab22f16f41c03f0ff49e752cd","observation_id":"c56a6026-5de0-47d0-b64f-14c5bcbfcb22","resolution":{"observed_at":"2026-08-10T22:03:46.788227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.775033Z","title":"Learning deep features to recognise speech emotion using merged deep CNN,","venue":null,"work_id":"46bae244-0070-44e8-b5be-b04624dc8c51","year":2018},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.323360Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:733486df6a28d7afcd334496ed55afdeb6fe8fb8c2fd03cb5b039c22188944db","observation_id":"2e3501cb-d60e-466a-8c92-4c2ec6c94b6a","resolution":{"observed_at":"2026-08-10T22:03:46.778509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11625","last_updated":"2022-09-23T14:51:55Z","snapshot_observed_at":"2026-08-06T15:00:53.477443Z","submitted_at":"2022-09-23T14:51:55Z","title":"The SpeakIn Speaker Verification System for Far-Field Speaker Verification Challenge 2022","version":1},"cited_work":{"arxiv_id":"2209.11625","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.11625","snapshot_observed_at":"2026-08-10T22:03:46.483815Z","title":"The SpeakIn Speaker Verification System for Far-Field Speaker Verification Challenge 2022","venue":"cs.SD","work_id":"366c1aa7-aad1-47e0-901a-f543a3d7e924","year":2022},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.327790Z"},"links":{"cited_paper":"/paper/2209.11625","citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:c8b500e97e482df3c1052e51e4b9b82f6e08a603777224302a01b65bc555ca4d","observation_id":"aaa42b2d-2d11-4800-a419-be10441767e2","resolution":{"observed_at":"2026-08-10T22:03:46.491560Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.764233Z","title":"IEMOCAP: Interactive emotional dyadic motion capture database,","venue":null,"work_id":"1caf253b-53d1-40bd-8596-6d66a7a57192","year":2008},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.332005Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:1070c978855125bb9abf828c356fb83834c01c2e026115ebb1154f1130a2bfcb","observation_id":"1adcb3af-0096-48bd-982d-03183cda01fb","resolution":{"observed_at":"2026-08-10T22:03:46.768265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.750428Z","title":"The ryerson audio-visual database of emotional speech and song RA VDESS: A dynamic, multimodal set of facial and vocal expressions in north american english,","venue":null,"work_id":"bb347841-a270-4610-9287-e8c66731f616","year":2018},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.335878Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:9007d3fb7e5264dffa389cffdda314376f896e4ad1af3d0c7829d74d368187e9","observation_id":"10d4eb0b-110f-4a64-8e1b-463a04f36d52","resolution":{"observed_at":"2026-08-10T22:03:46.755318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.738376Z","title":"Real- time end-to-end speech emotion recognition with cross-domain adapta- tion,","venue":null,"work_id":"ca1259a6-29d5-444b-96c8-d7cb1740201b","year":2022},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.339578Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:93495f88febca3344c35216cdb6598cfc7b211e993449e900ca615b8cc6b7058","observation_id":"bc1a721e-f373-4eb8-9588-e8a26d4e8a97","resolution":{"observed_at":"2026-08-10T22:03:46.742387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.724617Z","title":"A database of german emotional speech","venue":null,"work_id":"82d4b387-969b-440b-bc2e-a76609fb7d6d","year":2005},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.343453Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:99d3fcdd5a05bf56a65c45fca8d832964b94b3f77d66dea83879e35412b0b94a","observation_id":"caa75239-bb26-49a2-a7f8-401f5e1cd636","resolution":{"observed_at":"2026-08-10T22:03:46.729141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.712379Z","title":"Emovo corpus: an italian emotional speech database,","venue":null,"work_id":"62c9f585-fccd-4cf1-9e02-667e57eb9ed0","year":2014},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.347276Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:9b6e18e248e9498e6e20538d0d72f500e5e9bea3693a64a93e564d31f2b737fb","observation_id":"b185e9a2-5251-4935-9818-eec808a3723e","resolution":{"observed_at":"2026-08-10T22:03:46.716831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.698666Z","title":"The mexican emotional speech database (mesd): elaboration and assessment based on machine learning,","venue":null,"work_id":"ded914a8-7b27-4e11-b4c0-28f13a44dbae","year":2021},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.351021Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:79d05c4d8504258e60aa549dd53beb8cbc1de159f4fb4f6f7daf6acccaa395a7","observation_id":"7db1f795-113e-4958-87b5-8f0d9812ddd4","resolution":{"observed_at":"2026-08-10T22:03:46.703398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.354658Z","title":"Emotional voice conversion: Theory, databases and esd,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.354658Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:a5d76c0ffc86fedeeb6575d2cf7a7ac9f313863d5834d410f9e733969a5d91e6","observation_id":"2b29674c-226a-49af-92e2-a3054f1ea25a","resolution":{"observed_at":"2026-08-10T22:03:46.354658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.677357Z","title":"Towards discriminative representations and unbiased predictions: Class-specific angular softmax for speech emotion recognition","venue":null,"work_id":"32a0aa97-7bf3-430e-9842-cee3375c1765","year":2019},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.358869Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:35df4ddabba3151e88446c2168c3e1be6290a8065e8518752076a4c122777757","observation_id":"b28167ab-7754-40e5-bda5-81796de291b3","resolution":{"observed_at":"2026-08-10T22:03:46.681547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.665166Z","title":"Improving speech emotion recognition using graph attentive bi-directional gated recurrent unit network,","venue":null,"work_id":"b0c2afad-d4cb-4325-9bb8-2796ec89ccc2","year":2020},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.362435Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:886ebb5817e0115cae0ef598f950dd7e83288a4ca08c3fb4e97ad30e8cefc690","observation_id":"f877a1a3-1829-47ba-af7a-88ba5f563faf","resolution":{"observed_at":"2026-08-10T22:03:46.669951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.654462Z","title":"Hgfm: A hierarchical grained and feature model for acoustic emotion recognition,","venue":null,"work_id":"c5d73649-996d-4c04-b9f7-a6967657122d","year":2020},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.366274Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:06ff42480081db49ad83ddb81adf9a3209f0fe309ffb9b63c53f67a40b309559","observation_id":"910aa210-3996-44b8-a6af-1394c5706a06","resolution":{"observed_at":"2026-08-10T22:03:46.657924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.643201Z","title":"Cross- corpus speech emotion recognition with hubert self-supervised represen- tation,","venue":null,"work_id":"b09788ff-a99c-44a0-ba6f-0646f196c980","year":2022},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.370150Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:40367096b37a86438e5b1bddfa1d113e845802fe83c11560321d91c37766fc2b","observation_id":"a9dcfab3-f59b-4bc0-a18a-3285263b20b0","resolution":{"observed_at":"2026-08-10T22:03:46.646773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.631957Z","title":"Temporal modeling matters: A novel temporal emotional modeling approach for speech emotion recognition,","venue":null,"work_id":"f4b61348-f83b-48a6-9a8c-aaef933662a2","year":2023},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.374518Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:b66a3b456d14b60c6cabaf232ddbe9610c103a2090e2e837365993a9ff24d2b6","observation_id":"b319171d-682a-4f14-bbf7-d215ffdd5c9b","resolution":{"observed_at":"2026-08-10T22:03:46.635793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.618706Z","title":"Learning multi-scale features for speech emotion recognition with connection attention mechanism,","venue":null,"work_id":"8092dfcf-42ec-4967-a8bf-6b745de3e601","year":2023},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.378567Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:8c02be9ad99868fd12869cfec7809a7939e39ef7aa64ab3383d829f3abc38940","observation_id":"12670868-5e41-4cfc-ba70-eaa9de08a6bb","resolution":{"observed_at":"2026-08-10T22:03:46.622964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:47.061920Z","title":"Exploring wav2vec 2.0 fine tuning for improved speech emotion recognition,","venue":null,"work_id":"945fb242-0110-4695-bbb1-f1d958e0319e","year":2023},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.382309Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:fa023392f646facd1b6d00d20e60003316327cde17eff311407e135a44f08f8b","observation_id":"9b089bd3-6681-4a5b-bdf6-203a974d190d","resolution":{"observed_at":"2026-08-10T22:03:47.065910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.606067Z","title":"Unsupervised adversarial domain adaptation for cross-lingual speech emotion recognition,","venue":null,"work_id":"e4e0acc8-8c11-4daf-b562-a4c8d05acb91","year":2019},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.385929Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:127e6762d5fba8a19871e565f0ef29ef3babe481bd768d8b198cbc31077424b1","observation_id":"ef116f2c-77f8-4266-ba98-430ea4343ea2","resolution":{"observed_at":"2026-08-10T22:03:46.610408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.592225Z","title":"Speech emotion recognition from 3D log-mel spectrograms with deep learning network,","venue":null,"work_id":"f7fe17ce-e27c-457f-98e2-485716f79f45","year":2019},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.390039Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:ee080cf7151bf370322f9c0a8995e5736ab7a9a6102ea02e6830e0279102ee38","observation_id":"66fd3c04-cf38-4ab0-897b-42ef636f72b9","resolution":{"observed_at":"2026-08-10T22:03:46.597142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.579402Z","title":"Fusing visual attention CNN and bag of visual words for cross-corpus speech emotion recognition,","venue":null,"work_id":"f3e92361-f5a6-4440-9a2a-35d6e52a3704","year":2020},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.393861Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:699b86f2c070a11fd958361be2306bb7ef35b3a09081714bdbf52b8eb9400f9c","observation_id":"1a243e78-a50c-4836-b71b-d274313efb63","resolution":{"observed_at":"2026-08-10T22:03:46.583333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.945462Z","title":"Cross corpus multi-lingual speech emotion recognition using ensemble learning,","venue":null,"work_id":"e3cf4fdd-079b-486f-beb2-7397cbfcbc98","year":2021},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.397391Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:b285c73d66f37be7762819264dbe9a433d3a04cf048e98031ad23bf1463b4949","observation_id":"0dd1f7e1-74d4-475d-8937-b7ce804bb2bf","resolution":{"observed_at":"2026-08-10T22:03:46.949879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.567419Z","title":"Cross-corpus speech emotion recognition based on few-shot learning and domain adaptation,","venue":null,"work_id":"8884569b-b327-4e80-8965-309877ee2318","year":2021},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.400427Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:2526a48459d49f9a657fd3d01daf6452d979a9f90204efc0a1abe7df762a8a15","observation_id":"7fe177a5-5e7c-4965-8f01-0b397131db6e","resolution":{"observed_at":"2026-08-10T22:03:46.572085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.404732Z","title":"Crema-d: Crowd-sourced emotional multimodal actors dataset,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.404732Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:021b618093b78d2efec43f0fdd400b5b30e420336ad46b32231dd101d9832e96","observation_id":"01a88162-f488-419d-9c08-11aa484af918","resolution":{"observed_at":"2026-08-10T22:03:46.404732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.546637Z","title":"Enhancing cross-language multimodal emotion recognition with dual attention transformers,","venue":null,"work_id":"48caa6d8-b9bd-4939-87c3-f6ced76d8aec","year":2024},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.409923Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:4ab9c71f13797a01af0ae59c82f6da16ca62d404b652b7651dc7f957dff88660","observation_id":"e771e516-c8f7-4423-9b4d-68f39fb96eb9","resolution":{"observed_at":"2026-08-10T22:03:46.550903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-10T22:03:46.414254Z","title":"Roberta: A robustly optimized bert pretraining approach,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.414254Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:bf147d5751e60ac293c433037f9f58e709235215480c72b48ed3e5f391bd9072","observation_id":"76638cb0-65de-4f8a-8bdc-db5c787a6d3e","resolution":{"observed_at":"2026-08-10T22:03:46.414254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09296","last_updated":"2021-12-16T18:29:22Z","snapshot_observed_at":"2026-07-06T12:09:37.468149Z","submitted_at":"2021-11-17T18:49:42Z","title":"XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09296","snapshot_observed_at":"2026-08-10T22:03:46.418497Z","title":"Xls-r: Self-supervised cross-lingual speech representation learning at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.418497Z"},"links":{"cited_paper":"/paper/2111.09296","citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:f25676b55937c74e7f12d1354f955560f0a40b37e9ba8907c83b824cc23ae5df","observation_id":"438ddb48-b1ce-4bc2-871a-c440909606d6","resolution":{"observed_at":"2026-08-10T22:03:46.418497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.423506Z","title":"Robust speech recognition via large-scale weak supervi- sion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.423506Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:e93bd33a45f6894180722395003f2e5f4f0d0d966353b8276ae0e1640892855a","observation_id":"f224eeb2-635a-4306-8855-a694e17bbd5d","resolution":{"observed_at":"2026-08-10T22:03:46.423506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-10T21:55:54.889879Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":1,"verified_fuzzy":52},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2501.10408."}