{"as_of":"2026-08-07T09:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:07e72a01c5c96db7086d1438790b3b81b40e823bc100bcad99156b792f8e2be5","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T19:55:18.061325Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.16803/citation-record","integrity":"/paper/2607.16803/integrity","json":"/paper/2607.16803/citation-record.json","paper":"/paper/2607.16803"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:15.132185Z","title":"Speech emotion recognition in mental health: Systematic review of voice-based applications,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-07T00:34:01.944740Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:15.132185Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:3db5d1148f03beadbb46b2219020a822ab702be5c165836a0586c0585b092300","observation_id":"e2fb2689-45d8-42d4-aaf6-31396e32b81d","resolution":{"observed_at":"2026-08-01T19:55:15.132185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:15.167347Z","title":"Speech emotion recognition using supervised deep recurrent system for mental health monitoring,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-07T00:34:01.944740Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:15.167347Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:3f3789611ca6a59f9abd371c4e64f83c91b83454de228260edd4e71b3f584e0e","observation_id":"126f975b-0878-4c9c-8e6e-4cdf2761252a","resolution":{"observed_at":"2026-08-01T19:55:15.167347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:15.246690Z","title":"Speech databases, speech features, and classifiers in speech emotion recognition: A review,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-07T00:34:01.944740Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:15.246690Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:27e30b0fbb39b1f65fa828b13d318f1547478638e01c68bf1b86f9a60af80487","observation_id":"ee45029f-86bd-4734-bbbd-3d725f5d458b","resolution":{"observed_at":"2026-08-01T19:55:15.246690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:15.338720Z","title":"Survey of deep representation learning for speech emotion recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-07T00:34:01.944740Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:15.338720Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:c9a68b67c958d480875b102e43291786ed0d8c0ef1c1e2003fd8fc89d1e879dd","observation_id":"3bd0ab30-ae6b-4711-987f-bccea50bcfe6","resolution":{"observed_at":"2026-08-01T19:55:15.338720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:15.421480Z","title":"Convolution neural network based automatic speech emotion recognition using mel-frequency cepstrum coefficients,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-07T00:34:01.944740Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:15.421480Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:8caf5369e633d072d8f6ac672b16589ba14e6f343d24397c517b543cad371e9b","observation_id":"d45d8506-d6e0-4b25-9f34-0ae34ead3588","resolution":{"observed_at":"2026-08-01T19:55:15.421480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:15.538334Z","title":"Empirical evaluation of deep recurrent deep neural net- works models for speech emotion recognition for real time applications,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-07T00:34:01.944740Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:15.538334Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:4bb6f7c05eb06047fe73883705dee260992b16073790743dad284e3cab4b69ac","observation_id":"034c70b3-dc67-4f25-a3ad-43b8000a67dd","resolution":{"observed_at":"2026-08-01T19:55:15.538334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:15.713373Z","title":"Vesper: A compact and effective pretrained model for speech emotion recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-07T00:34:01.944740Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:15.713373Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:67d24203060daee2f93d18cf82801364ff4988c3c040d1e4e1998b0ae8099560","observation_id":"a47b5d70-8002-4f77-a443-fcc1dc054b1d","resolution":{"observed_at":"2026-08-01T19:55:15.713373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:15.815799Z","title":"Benchmarking pretrained models for speech emotion recognition: A focus on Xception,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-07T00:34:01.944740Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:15.815799Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:e130cd491df3a0a872e9c60d6663bdec04f5c7ef47baf50968233ba74487b161","observation_id":"ce2af0db-e678-4755-934d-b5ebccacbdf6","resolution":{"observed_at":"2026-08-01T19:55:15.815799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:15.964076Z","title":"Pre- trained deep convolution neural network model with attention for speech emotion recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-07T00:34:01.944740Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:15.964076Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:cee4424ce8813b193b7b30614b39890c249b6ad3351b8c310142725070823746","observation_id":"b1dc981c-718e-46f5-b34c-2b1ff992e427","resolution":{"observed_at":"2026-08-01T19:55:15.964076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:16.129378Z","title":"Tc-net: A modest & lightweight emotion recognition system using temporal convolution network.,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-07T00:34:01.944740Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:16.129378Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:8fbdc877ba956a22d8f68161d4e28628fde8b02b339cc7b75ead8ffa80339ac4","observation_id":"422948e7-16ff-4bb2-9eda-c1bbe80c89d9","resolution":{"observed_at":"2026-08-01T19:55:16.129378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:16.276537Z","title":"LiteLSTM architecture based on weights sharing for recurrent neural networks,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-07T00:34:01.944740Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:16.276537Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:b4baf5fd2f8af6b7e9926c86bf9925df18a9cdc80d9865bcfde14f4f7570c12e","observation_id":"1c5e5ce3-b981-40b4-b361-9bd0b7833bfc","resolution":{"observed_at":"2026-08-01T19:55:16.276537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.05630","last_updated":"2018-09-11T18:05:16Z","snapshot_observed_at":"2026-07-06T06:23:40.577450Z","submitted_at":"2018-02-15T16:05:02Z","title":"CNN+LSTM Architecture for Speech Emotion Recognition with Data Augmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.05630","snapshot_observed_at":"2026-08-01T19:55:16.329557Z","title":"Cnn+ lstm architecture for speech emotion recognition with data augmentation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-07T00:34:01.944740Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:16.329557Z"},"links":{"cited_paper":"/paper/1802.05630","citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:777a2af5ae38d6bb382ec416edbe670beec7b2d5f12b56ce4663d63be319d182","observation_id":"46a5a2d6-964a-4e20-bac8-14d57085f611","resolution":{"observed_at":"2026-08-01T19:55:16.329557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:16.385918Z","title":"Speech emotion recognition using deep 1D & 2D CNN LSTM networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-07T00:34:01.944740Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:16.385918Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:df9f2bf936b5091894f5a8af5866a6fb9f2f470651f3a673ac8e20f13f133479","observation_id":"3f31fa8b-53e0-4aa1-b023-cdcc98380ff8","resolution":{"observed_at":"2026-08-01T19:55:16.385918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:16.455679Z","title":"Robust speech emotion recog- nition using cnn+ lstm based on stochastic fractal search optimization algorithm,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-07T00:34:01.944740Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:16.455679Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:ffca93e4abfad4831617c526ed1c5ee848e4f4a4df8aff22cb2c8b33cd8741a5","observation_id":"3e5f3748-ce59-4ac2-bb9b-a916cb0cd2f1","resolution":{"observed_at":"2026-08-01T19:55:16.455679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:16.516904Z","title":"Speech emotion recognition using deep convolutional neural network and discriminant temporal pyramid matching,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-07T00:34:01.944740Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:16.516904Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:e2e1b742c1c929be2b77c53e894d985e5b9d964300669e4d19ca3890fa66ede4","observation_id":"a64f7701-1950-4fde-9e63-7e861ef8a769","resolution":{"observed_at":"2026-08-01T19:55:16.516904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:16.685671Z","title":"Speech emotion recognition: Two decades in a nutshell, benchmarks, and ongoing trends,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-07T00:34:01.944740Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:16.685671Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:49839a1ce7460376b3e3d6ef2c3f2b55a943eaffef0853496f94cd0b3a39c876","observation_id":"e0fa6ad4-3220-4c17-9906-15feb4c9526a","resolution":{"observed_at":"2026-08-01T19:55:16.685671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:16.761965Z","title":"Lightweight deep learning framework for speech emotion recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-07T00:34:01.944740Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:16.761965Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:8b504fc87eeee8f0da28edeacc28a4438eb99240345aa6a496bc15ae5858589d","observation_id":"a44ed362-3ea6-4cdd-82f3-8d51b7636143","resolution":{"observed_at":"2026-08-01T19:55:16.761965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:16.834528Z","title":"Speech emotion recognition on mobile devices based on modulation spectral feature pooling and deep neural networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-07T00:34:01.944740Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:16.834528Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:c67b8fd2954c587f2f35da190942bd70530af0d423f9ae21604c7659f6adc01e","observation_id":"89e1dfd3-fb8d-4f85-b4b0-ba0fa66b1998","resolution":{"observed_at":"2026-08-01T19:55:16.834528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:16.984015Z","title":"A systematic re- view of interpretability and explainability for speech emotion features in automatic speech emotion recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-07T00:34:01.944740Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:16.984015Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:57deb793e63719b906c71e2123e0aba89812d1897e37a7e320ec5b56d530c894","observation_id":"e646d0a4-68b9-4e88-bce3-b81131eeea7a","resolution":{"observed_at":"2026-08-01T19:55:16.984015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23437","last_updated":"2025-06-30T00:21:07Z","snapshot_observed_at":"2026-08-07T00:36:32.143187Z","submitted_at":"2025-06-30T00:21:07Z","title":"From Large-scale Audio Tagging to Real-Time Explainable Emergency Vehicle Sirens Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23437","snapshot_observed_at":"2026-08-01T19:55:17.069432Z","title":"From large- scale audio tagging to real-time explainable emergency vehicle sirens detection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-07T00:34:01.944740Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:17.069432Z"},"links":{"cited_paper":"/paper/2506.23437","citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:66e766bf7537906e9025a925a8fa24a22705e54aa6da8041e4ef624b8fa56c8f","observation_id":"130b39d2-963d-48e0-8b00-9211cf7d7743","resolution":{"observed_at":"2026-08-01T19:55:17.069432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:17.161487Z","title":"Grad-cam: Visual explanations from deep networks via gradient-based localization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-07T00:34:01.944740Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:17.161487Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:9c6aa7ce65d001f1d80e09fb6188705752197a31c991931cd96093a91bc367c3","observation_id":"2e652d45-0a4d-4863-a6f4-d97e252aed99","resolution":{"observed_at":"2026-08-01T19:55:17.161487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:17.294713Z","title":"Socio-technical risks of clinical speech-to-text systems: Transparency, privacy, and reliability challenges in ai-driven documen- tation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-07T00:34:01.944740Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:17.294713Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:771916d2a3ca1c8ae7788b8729ccd6b1f148bb8d73c9d9787660bccdd9949a1a","observation_id":"124f356c-fbdd-4aaf-99e5-fca7bb8e7f3b","resolution":{"observed_at":"2026-08-01T19:55:17.294713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:17.439760Z","title":"Fusion of log-mel spectrogram and acoustic features for driver speech emotion recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-07T00:34:01.944740Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:17.439760Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:1326e31168dc6dd49e355f44a1e70919ac49aef035b696b8b7f4979743132562","observation_id":"881b3a08-9c43-44d1-bee0-057fb0240f64","resolution":{"observed_at":"2026-08-01T19:55:17.439760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:17.506914Z","title":"Combining frame and turn-level information for robust recognition of emotions within speech,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-07T00:34:01.944740Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:17.506914Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:33b8bcdb34237b32fc3c619366e14d137d2c6856912711b1c4bbf8d9a47ca19f","observation_id":"7778bbaf-292c-4ea2-8870-c41c229e78d9","resolution":{"observed_at":"2026-08-01T19:55:17.506914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:17.579051Z","title":"Audio-visual feature selection and reduction for emotion classification,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-07T00:34:01.944740Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:17.579051Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:45042a866bbd14224bcfd7de7aab782b12d706d55e032425d56043cbe31806a4","observation_id":"7210a7cd-c667-4558-baa5-1a56a5804b26","resolution":{"observed_at":"2026-08-01T19:55:17.579051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:17.647710Z","title":"Speech emotion recognition using convolutional neural networks with attention mecha- nism,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-07T00:34:01.944740Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:17.647710Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:f3d7dd6363645199906cd482391aeb515801e09a98586ef7a79054b2e365d255","observation_id":"b264b867-d2fe-43e7-8aea-aa7501763ee7","resolution":{"observed_at":"2026-08-01T19:55:17.647710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:17.693481Z","title":"Speech emotion recognition based on adaptive feature fusion network,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-07T00:34:01.944740Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:17.693481Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:1a1d08288f2f1c5339643952031f6ccfce5e03b5d695c18819b3ba7bed7a57ca","observation_id":"e4ce8fbf-c489-4a1c-9c89-c09d0e514651","resolution":{"observed_at":"2026-08-01T19:55:17.693481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:17.744900Z","title":"Speech emotion recognition through hybrid features and convolutional neural network,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-07T00:34:01.944740Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:17.744900Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:a2636f7597a08fce52d1f3fa5462897465b00a31ce82c2653374129be18485f1","observation_id":"56dc4ed1-1955-478e-a713-c52e5753b16b","resolution":{"observed_at":"2026-08-01T19:55:17.744900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:17.782052Z","title":"Speech emotion recognition and classification using hybrid deep cnn and bilstm model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-07T00:34:01.944740Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:17.782052Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:4c0e6a477916cc74e71b1cf874513a427245a5f89a89ec5ec3ddc7079e39a7ab","observation_id":"e9b88f8c-e861-47ad-910a-2fd763d4b581","resolution":{"observed_at":"2026-08-01T19:55:17.782052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:17.789503Z","title":"Recognition of emotion behind speech using deep learning RESNET algorithm,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-07T00:34:01.944740Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:17.789503Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:5766d99dda962a748f156a800d6ce7b29cdf3a93573fdb3556be1a3a1c0de10b","observation_id":"b87afb48-2d78-416d-991f-3e7ee1f18d0e","resolution":{"observed_at":"2026-08-01T19:55:17.789503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:17.864835Z","title":"A deep learning approach for speech emotion recognition optimization using meta-learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-07T00:34:01.944740Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:17.864835Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:eabfd7f9548294781afab09c9af252803c44455b35709217fa3769a06af1e8c2","observation_id":"193d198d-8a49-4384-a46d-98128db85c5d","resolution":{"observed_at":"2026-08-01T19:55:17.864835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:17.961201Z","title":"Speech emotion recognition using deep learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-07T00:34:01.944740Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:17.961201Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:6a776ff4958a9440eacea8fab8b79d1dd3d639d0db8587c3be76a54aef226f0f","observation_id":"84283575-78ca-4a86-a04a-08e4087bdc4e","resolution":{"observed_at":"2026-08-01T19:55:17.961201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:18.001403Z","title":"Speech emotion recognition using machine learning: A comparative analysis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-07T00:34:01.944740Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:18.001403Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:0ffb4100ada4bfc7b958cc2527ccc9db4fed2cc134845dff3fb0c91c2b4b6f2e","observation_id":"155148c2-8af5-4133-a3e9-e8f452b4a92a","resolution":{"observed_at":"2026-08-01T19:55:18.001403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10666","last_updated":"2025-01-18T06:15:54Z","snapshot_observed_at":"2026-07-06T20:22:45.422714Z","submitted_at":"2025-01-18T06:15:54Z","title":"Speech Emotion Detection Based on MFCC and CNN-LSTM Architecture","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10666","snapshot_observed_at":"2026-08-01T19:55:18.061325Z","title":"Speech emotion detection based on MFCC and CNN- LSTM architecture,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-07T00:34:01.944740Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:18.061325Z"},"links":{"cited_paper":"/paper/2501.10666","citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:6fbe776dd8907a8dfb61950c009df9ac4d6def6b77516995e5cbddcd3bbd5527","observation_id":"9e87df13-b8c2-4bf1-a5e3-5575ff89b164","resolution":{"observed_at":"2026-08-01T19:55:18.061325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T00:34:01.944740Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2607.16803."}