{"as_of":"2026-08-08T02:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c88c1616059599c56141ddb1fd42786803f6ed539a64be790123ab4b8bab37c8","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:54:15.683108Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:54:10.171701Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T12:54:15.802818Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"cited_work":{"arxiv_id":"2505.23236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23236","snapshot_observed_at":"2026-08-07T12:54:15.802818Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","venue":"cs.SD","work_id":"6ec83571-ac9d-4d6e-8a2b-b58b34d5b393","year":2025},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:10.171701Z"},"links":{"cited_paper":"/paper/2505.23236","citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:36a3b9d8c3e1cff7e5ae944a8b08ceb774e3011f451b0f8fc6131c2a86956f26","observation_id":"d52dbc93-a0e9-4856-8893-20c920284adb","resolution":{"observed_at":"2026-08-07T12:54:15.893612Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23236/citation-record","integrity":"/paper/2505.23236/integrity","json":"/paper/2505.23236/citation-record.json","paper":"/paper/2505.23236"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:27.068390Z","title":"Despite decades of promising advance- ments, most research [1–4] has primarily focused on classify- ing speech into single, discrete emotion categories","venue":null,"work_id":"857ed80f-cb26-4c48-9ce9-795566a04034","year":null},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:09.919825Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:7a63be195449e918936608fcf2337917454ef6fceebb0518dab96ba9ab80016f","observation_id":"299bf55c-e888-42e3-b1e7-39169c2fa4e4","resolution":{"observed_at":"2026-08-07T12:54:27.195734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:26.940822Z","title":"In contrast, previous research paid attention to either feature disentan- glement [6–17] or fine-grained emotion descriptor prediction [5, 23–26] alone","venue":null,"work_id":"2abce065-ca2c-4b58-afbc-64525a676c14","year":null},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:10.008381Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:aa6f16ed0fb144eabdabcd0e6727ca372721171ce04154223495d3f78a110b8f","observation_id":"a9f3eab2-c1fb-461b-9722-873266a0ca68","resolution":{"observed_at":"2026-08-07T12:54:27.004534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:26.750308Z","title":"In contrast, prior research employs external ASR models to generate transcripts before performing SER [12–17], which may lead to low SER performance affected by ASR er- rors","venue":null,"work_id":"9529bc9f-b0fb-4804-8bb8-d4c864e9faf0","year":null},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:10.078784Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:0814e453f71ce63fe37294b410b1ab79e73d115832afc830848706a61c5a180f","observation_id":"3712781b-f7e8-434e-ad74-b333098e0403","resolution":{"observed_at":"2026-08-07T12:54:26.823215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"cited_work":{"arxiv_id":"2505.23236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23236","snapshot_observed_at":"2026-08-07T12:54:15.802818Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","venue":"cs.SD","work_id":"6ec83571-ac9d-4d6e-8a2b-b58b34d5b393","year":2025},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:10.171701Z"},"links":{"cited_paper":"/paper/2505.23236","citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:36a3b9d8c3e1cff7e5ae944a8b08ceb774e3011f451b0f8fc6131c2a86956f26","observation_id":"d52dbc93-a0e9-4856-8893-20c920284adb","resolution":{"observed_at":"2026-08-07T12:54:15.893612Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:26.611501Z","title":"Alternating Multi-task Fine-tuning A parameter-efficient fine-tuning method known as low-rank adaptation, or LoRA [27], is widely employed to fine-tune the LLM-based models","venue":null,"work_id":"6a2e8a73-06e6-41b3-9ac6-5c4b47c0dcb4","year":null},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:10.279559Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:c7dcac7e650e0703bc51b4cc9ce662136a2399e8331b7e473492f4c889293218","observation_id":"47965573-3fe0-424a-96d6-35b3c71ee6fe","resolution":{"observed_at":"2026-08-07T12:54:26.664845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:25.531708Z","title":"14200220, 14200021, 14200324, Innovation Technology Fund grant No","venue":null,"work_id":"ceef860b-19d8-4ec0-866a-879e6c944e24","year":null},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:10.722341Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:45ec79a6c68821c3e6bdfcdb2d2e1e375d98d7d8b98e3754ed3765394c60738a","observation_id":"c68910f4-1435-4639-b716-444836c08e28","resolution":{"observed_at":"2026-08-07T12:54:25.664004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:26.239108Z","title":"1, the architecture of our approach consists of a HuBERT encoder, two feature disentanglement blocks, two feature adapters and an LLM decoder","venue":null,"work_id":"5770b8f9-58f4-4af1-9327-33fb02628a6a","year":null},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:10.437938Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:b60f9b975847b338fee1e11ba0ec22b1a6747f64794046c6bcb68985ad7bfa47","observation_id":"26923b06-ce5f-41c0-b26e-618f3bf866b5","resolution":{"observed_at":"2026-08-07T12:54:26.344816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:25.978679Z","title":"excited” with “happy","venue":null,"work_id":"9fc8e0ea-a68d-4d68-ac03-ff2478dba6a6","year":null},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:10.525020Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:7facbc265045336db5fa71598f57f1da52718d1402aed363e2dcfa27b9db3c9d","observation_id":"4585293c-632d-4576-aea5-21e6d759d208","resolution":{"observed_at":"2026-08-07T12:54:26.126722Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:25.805697Z","title":"Fine-grained SED features are dis- entangled from HuBERT SSL representations via alternating LLM fine-tuning to joint SER-SED prediction and ASR tasks","venue":null,"work_id":"9d77e736-34cb-424c-a04c-7c7398e19672","year":null},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:10.608679Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:c4b2d8eec7f3809edf41025ff67e40b6d68a014e0f4befb28d60f8441bbba794","observation_id":"b47ff2dc-0a09-458c-8e03-d54d1e487898","resolution":{"observed_at":"2026-08-07T12:54:25.890238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:23.278915Z","title":"Leveraging speech ptm, text llm, and emotional tts for speech emotion recognition,","venue":null,"work_id":"44a8e297-48ea-4e41-960d-a43df03a9188","year":2024},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:11.694405Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:f655c5783b38bc8e7a0ff6054f1f4ee00ce29d4d1482973611869776bed7cd37","observation_id":"8e3704ce-b016-4f73-bdcf-bc0477927b63","resolution":{"observed_at":"2026-08-07T12:54:23.377744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:25.315998Z","title":"Emotion neural transducer for fine-grained speech emotion recognition,","venue":null,"work_id":"ba52d1d2-f45f-4d5e-a2e5-242303b279d4","year":2024},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:10.821947Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:c6620ea749dc1a3b72580c2490292d8e97d9672e12ea0c13ebfef0dd09b5efa8","observation_id":"716a1476-f4f9-46f6-9363-dbd705f1728c","resolution":{"observed_at":"2026-08-07T12:54:25.426744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:25.096040Z","title":"Generalization of self-supervised learning- based representations for cross-domain speech emotion recogni- tion,","venue":null,"work_id":"e0b60983-bcc8-4caf-b58c-44a22f594eae","year":2024},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:10.899986Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:ddaf3a4c43bb1288a4f42ef2aa0977a5729697ae8bdae09cb85174c20ca96654","observation_id":"4f662225-8bba-4bed-be4d-3c4337f3fdaa","resolution":{"observed_at":"2026-08-07T12:54:25.211711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:24.875866Z","title":"Noise-robust speech emotion recognition us- ing shared self-supervised representations with integrated speech enhancement,","venue":null,"work_id":"9ef9fe1a-6424-4e0a-b109-3f83d6ac26c1","year":2025},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:11.004641Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:f769a749c0c7e28a24435d700a8e97d7ed94c53b1d807ae048d8d7e7ac9e2eba","observation_id":"94d8e0c1-0e4a-45f4-9df4-ae74b8e0a9d3","resolution":{"observed_at":"2026-08-07T12:54:24.981964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:24.578349Z","title":"Emix: a data augmentation method for speech emotion recognition,","venue":null,"work_id":"d0877750-6fb0-4bfc-8ad0-5c2af5728e05","year":2023},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:11.096176Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:0e2414ad3500fd07acf1c383bfd78eb6faf8cf0cb20444dd280c4d7f12f68d84","observation_id":"13c806fb-b9d8-4308-b06e-2c72e5de67df","resolution":{"observed_at":"2026-08-07T12:54:24.750454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:24.376490Z","title":"Secap: Speech emotion captioning with large lan- guage model,","venue":null,"work_id":"c6377aba-ded1-43eb-9330-8ba306d90d45","year":2024},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:11.195114Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:8c2f5b5b958b5dbf72f1aaf303e52c23409ace0f28cbbad3aa8c27fde2ac5cd3","observation_id":"9aac4409-4fb3-4d54-90b8-195bc3af614c","resolution":{"observed_at":"2026-08-07T12:54:24.475284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:23.951577Z","title":"Disentangling textual and acoustic features of neural speech representations,","venue":null,"work_id":"efd1c2b0-7dd8-4a5e-9beb-2fcbaa616cf7","year":2024},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:11.376928Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:7b465f4e5ed3251e5f6a034a82a1b550ff42bad154c5d06821ab34bc7d27b74e","observation_id":"740cd773-f56f-4f3a-a9d8-b7540c1ba9fd","resolution":{"observed_at":"2026-08-07T12:54:24.025148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:23.707045Z","title":"Variational information bottleneck for effective low- resource audio classification,","venue":null,"work_id":"5bda3513-1e4d-4adc-a7c9-2d47e67e2db3","year":2021},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:11.480535Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:dc6d571c682a985f2360520000f125ec55dec9e64ec80e92fb1d60c119fcad9b","observation_id":"3040545b-d819-40e2-a2e2-ee840debd6a8","resolution":{"observed_at":"2026-08-07T12:54:23.837850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:23.490250Z","title":"Multi-modal emotion recognition using multiple acoustic features and dual cross-modal transformer,","venue":null,"work_id":"8860f9e8-5541-4fd0-9451-243159e53d5b","year":2024},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:11.555204Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:d9223306fa825248acdec5b1e403209ee065576279d8677019563d92144e566f","observation_id":"b4a85e3a-78f4-4da5-908f-b9324d49f97e","resolution":{"observed_at":"2026-08-07T12:54:23.595496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:20.868052Z","title":"Wavllm: Towards robust and adaptive speech large language model,","venue":null,"work_id":"b7496025-979c-4475-9556-4d7a6f0f6c63","year":2024},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:12.971182Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:d3eeb66bbb385c4807bc3730445cc936e71bccdb82c9a1f7fa4dc837290d081b","observation_id":"7702ef33-39a3-426b-a7ce-8948dfbd3e2b","resolution":{"observed_at":"2026-08-07T12:54:21.033794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:23.098362Z","title":"Variational information bottleneck based regular- ization for speaker recognition","venue":null,"work_id":"45b5a2fb-a2bd-43dd-95a5-545f6574414c","year":2021},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:11.790971Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:c149755654ba0a822aca6a9ea58f3442867eb041fd5fdb51165bf04d4109f230","observation_id":"6bf1cdef-f5d6-49c1-8b1a-3573adcae58d","resolution":{"observed_at":"2026-08-07T12:54:23.172317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:22.906405Z","title":"Speech emotion recognition combining acous- tic features and linguistic information in a hybrid support vector machine-belief network architecture,","venue":null,"work_id":"5cf291a0-68cc-4b88-bfee-3c01ca24112b","year":2004},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:11.875837Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:352404f5a7bee653a46f2f14ee41ed2633c7dfe855c9302477c5d978410616e6","observation_id":"59b65e9c-a181-48dd-b492-c7d643c712b5","resolution":{"observed_at":"2026-08-07T12:54:23.035813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:22.643166Z","title":"Speech emotion recognition with multi-level acoustic and semantic information extraction and interaction,","venue":null,"work_id":"37664928-9aac-4273-b624-dc091052710c","year":2024},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:11.972808Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:cd39c7e53cb650d5bb34244f46f32bb627c2ad358df70a15f1cc6f459151f937","observation_id":"624ceb2a-ce2b-4856-a431-8a132c52e55a","resolution":{"observed_at":"2026-08-07T12:54:22.769508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:22.238288Z","title":"Multimodal emotion recognition with high-level speech and text features,","venue":null,"work_id":"a92b7fac-a917-4ac8-98e3-5fad2bcc3450","year":2021},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:12.128689Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:fbe1e6722348e70b5a7d3cb4d55e01adff3f639306059d9c178bd2c293023739","observation_id":"ed8e0c42-30f3-4929-a271-fc278ac44fe4","resolution":{"observed_at":"2026-08-07T12:54:22.313076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:22.022263Z","title":"Frontend attributes disentanglement for speech emotion recognition,","venue":null,"work_id":"681477ef-fe12-4966-b362-a3704a52af62","year":2022},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:12.234483Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:d25cc4752a67dce1cd07b554c8fb1c7be1d2941b14cf28afa83611b37b248d99","observation_id":"5a8d77da-1007-4932-a324-c5433791a6ca","resolution":{"observed_at":"2026-08-07T12:54:22.101428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:21.834158Z","title":"Speech emotion recognition with acoustic and lexi- cal features,","venue":null,"work_id":"9cb8a6ed-d7a7-4336-bbfb-c029b03b7064","year":2015},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:12.531610Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:c44029d67f214a92e0e83c74ea0981e5cd51e7109d68d1bbbd18669bf3f9cf4d","observation_id":"a882d128-dc8f-49e8-ad31-34f87f78b8d4","resolution":{"observed_at":"2026-08-07T12:54:21.934431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:21.602211Z","title":"Salmonn: Towards generic hearing abilities for large language models,","venue":null,"work_id":"9e955c58-5509-4f5c-a25a-886ae4dfe2e2","year":2023},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:12.780806Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:49a79629ab002e55325957b9e60aa5fbf470a3c0451c68bd6b486504e926d91e","observation_id":"b906f673-8626-4d6a-8ee2-9e72177f15b3","resolution":{"observed_at":"2026-08-07T12:54:21.753545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:26.404043Z","title":null,"venue":null,"work_id":"0dc26f3c-f963-408d-845d-022e7bf198a3","year":null},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:10.346016Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:da2e06eabeaaf79d966d85d3d7236a269e78db7427f81c6c7d3548effcbfdf65","observation_id":"afc23d35-1a44-4f0d-8a8f-97ef8a5fb68b","resolution":{"observed_at":"2026-08-07T12:54:26.472177Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:21.182780Z","title":"Qwen-audio: Advancing universal audio under- standing via unified large-scale audio-language models,","venue":null,"work_id":"c2de9a83-1adc-416d-8578-d04610dee94a","year":2023},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:12.878612Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:512ef53386c7d2de41a670c2194faa57393c346d200403e2b06c6b3931dd7c3e","observation_id":"e3837274-6619-42bd-97ba-967e69161b12","resolution":{"observed_at":"2026-08-07T12:54:21.396711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:20.481006Z","title":"Enhancing multimodal emotion recogni- tion through asr error compensation and llm fine-tuning,","venue":null,"work_id":"08086c3f-31f7-4e41-b64e-19c28cb695a6","year":2024},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:13.051955Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:e61d7c7b687458531b3e74d79c944b7478e0aa8fa44b6d242c98db6bef9ed663","observation_id":"ff9d09bc-26d4-49bc-88bd-29d2442f8e7d","resolution":{"observed_at":"2026-08-07T12:54:20.704496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:19.858716Z","title":"Large language model based generative er- ror correction: A challenge and baselines for speech recognition, speaker tagging, and emotion recognition,","venue":null,"work_id":"adc1a818-1171-459c-9c2c-ce856e2ad8ee","year":2024},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:13.128936Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:ad4c1aa26cc6622d0fcd0b86ef9d489483ae8038ddb1962732efc63cb2dd8e6a","observation_id":"3087c5ac-ee59-4db2-a8af-9f2cea5ff593","resolution":{"observed_at":"2026-08-07T12:54:19.935739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:19.726487Z","title":"Wavcaps: A chatgpt-assisted weakly-labelled au- dio captioning dataset for audio-language multimodal research,","venue":null,"work_id":"31604957-cc37-4102-937a-db5576bee133","year":2024},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:13.224482Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:4c4f1e906cffd2cb501061b1fbd86821e3618dc26b5133e4103e33593b729891","observation_id":"ccce4f50-bd73-43ed-aa9b-42db47a99720","resolution":{"observed_at":"2026-08-07T12:54:19.774077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:19.540125Z","title":"Training audio captioning models without audio,","venue":null,"work_id":"24ba10e6-8f66-4f0b-8b2a-153218f92e6e","year":2024},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:13.289487Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:fd86b454501954f01c14be133da82f737899e6baa0f75be1bc1aab327bdaeea0","observation_id":"236dcc7a-36b2-4c24-a825-66e6e45d5d81","resolution":{"observed_at":"2026-08-07T12:54:19.631531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:19.403701Z","title":"Aligncap: Aligning speech emotion captioning to human preferences,","venue":null,"work_id":"a8a31de4-f3af-4d88-aa64-f1b8c07363fe","year":2024},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:13.369212Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:a7008e010022e44e0bfe99d2164066667e96d5c399bf68a04997567a8bbbcc70","observation_id":"8f2c1027-8a5f-4574-b1d5-0344ca928ad4","resolution":{"observed_at":"2026-08-07T12:54:19.458611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:19.288559Z","title":"Clap4emo: Chatgpt-assisted speech emotion retrieval with natural language supervision,","venue":null,"work_id":"f8eb5ef3-9608-47cf-bd5a-cb27eca48809","year":2024},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:13.461108Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:bf083f8cd999d522c2d0f1223140255861f434806a42e25f69c6f7b55b11ed2f","observation_id":"c85479cf-1aea-4d70-b757-9613e146ce3c","resolution":{"observed_at":"2026-08-07T12:54:19.334182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:19.193764Z","title":"Lora: Low-rank adaptation of large language mod- els,","venue":null,"work_id":"ffb744de-9fdf-4bd5-a31c-79f65fed0ae4","year":2021},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:13.593844Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:a4b98a2f4bbe1b1714bd611c26cb13c13ef2106dd9558ca067b0ffa0da98ecbd","observation_id":"cb537344-8ba7-4119-bf11-b9784529c642","resolution":{"observed_at":"2026-08-07T12:54:19.240431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:19.088388Z","title":"The information bottleneck method,","venue":null,"work_id":"102d8ffd-6689-47f2-b9dc-7be56879d5b1","year":2000},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:13.669080Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:0747a7746fdec4c1e9fd3ec4fe3d2d374f4d52475aed1659608f72ff9e80d6b5","observation_id":"b977f26b-6c85-4318-86a5-00192b7efe7a","resolution":{"observed_at":"2026-08-07T12:54:19.139601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:18.967505Z","title":"Deep variational information bottleneck,","venue":null,"work_id":"6cf18528-d2dc-4976-a2c5-d22917e36142","year":2017},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:13.753112Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:ff82b98ae21c047ffa705f88d76256cd4204f2cfbbba47fb690c1b51cb0f4be8","observation_id":"95e23167-2ebd-4a8e-a363-70e84235377a","resolution":{"observed_at":"2026-08-07T12:54:19.038394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:18.817419Z","title":"Auto-encoding variational bayes,","venue":null,"work_id":"93f3804a-0597-4c99-b88e-1db53efcc345","year":2014},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:13.829934Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:2af689f7679b0d811b88396706da0a3c9f17e5aa119003c00c2fc254e2d2b7d0","observation_id":"59cd97ba-1cbb-434c-ba5f-e193df4c84ff","resolution":{"observed_at":"2026-08-07T12:54:18.880438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:18.699649Z","title":"Bayesian learning for deep neural network adapta- tion,","venue":null,"work_id":"5035b529-80b3-47ad-aff8-a9ff535ec5ba","year":2021},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:13.900142Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:4c180d552339da19e52bcd818a3edb2d9d95ec358bb8cc62028b0b2cb5d42f7b","observation_id":"0b6ec395-0850-474e-a5ea-b1d4d6ecf308","resolution":{"observed_at":"2026-08-07T12:54:18.749934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:18.559742Z","title":"Bayesian learning of lf-mmi trained time delay neu- ral networks for speech recognition,","venue":null,"work_id":"17d0dd05-fe71-4418-845b-e900b5f32f7d","year":2021},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:14.009523Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:9990cbe0302a0eccefe92ec95247fa3e2507fb54eac629a4f711a5b9d7717cd7","observation_id":"fdb40e3d-b583-4f48-a330-d9b62c74d6d1","resolution":{"observed_at":"2026-08-07T12:54:18.624336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:18.394492Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":"14d53494-8fa8-4fde-960c-495072e9ab07","year":2021},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:14.119442Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:af64463ab886ff2872e811df630306871ad6540db3ea8068c29f010426c8dc98","observation_id":"7232bbc3-b526-43a5-a79d-00a6b2c17bdd","resolution":{"observed_at":"2026-08-07T12:54:18.483936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:18.205319Z","title":"Distilhubert: Speech representation learning by layer-wise distillation of hidden-unit bert,","venue":null,"work_id":"f77e79da-1388-4c06-8361-80689d793a75","year":2022},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:14.253340Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:1838a3aeb13f79baef0f9a58b05da047c481b2a7236d0e87adc2cec30200436e","observation_id":"9bdb7cdb-4b49-493b-b74c-8486e530d22f","resolution":{"observed_at":"2026-08-07T12:54:18.295954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:17.961795Z","title":"Llama-omni: Seamless speech interaction with large language models,","venue":null,"work_id":"e0147e8e-ae7b-4a5d-ace4-2f3420486b46","year":2024},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:14.362188Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:4fd9224bf82808aeecf3ac8e35452eeaa2ac78e986a72f3025c3a644af35896d","observation_id":"1fd39b26-c849-4e36-a363-4786a9f4459c","resolution":{"observed_at":"2026-08-07T12:54:18.076092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:17.802041Z","title":"The llama 3 herd of models,","venue":null,"work_id":"316468d5-34aa-44f2-bfec-a2dde41aeb23","year":2024},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:14.473295Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:a06cd15f48f35f5e48ad1036bf93891e70f1d77b1e909162efda9de1af5903f1","observation_id":"28d1e536-a0d7-4aa7-8387-254eb5b1cb90","resolution":{"observed_at":"2026-08-07T12:54:17.869159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:17.618342Z","title":"Speechcraft: A fine-grained expressive speech dataset with natural language description,","venue":null,"work_id":"097025af-31c4-44d0-88bf-80d4bbcc7300","year":2024},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:14.569750Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:77bca1ac5e429eb378f10055f43ecc74e832d33c4859949d23e86209d954d1b9","observation_id":"36a18816-7956-4c8a-bc2c-b5942ffe45ab","resolution":{"observed_at":"2026-08-07T12:54:17.708347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:17.465901Z","title":"Gigaspeech: An evolving, multi-domain asr cor- pus with 10,000 hours of transcribed audio,","venue":null,"work_id":"715777e8-1921-436e-a4f1-d918ec8fa099","year":2021},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:14.677391Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:680095db66309b24875c775158d0bb132c35037494e6bd69e05e8d9a79a7e61f","observation_id":"57555cf5-8236-49a1-9e33-98d395790851","resolution":{"observed_at":"2026-08-07T12:54:17.535276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:17.289736Z","title":"Emosec: Emotion recognition from scene context,","venue":null,"work_id":"781757ab-0953-43cc-b9e9-2055b1c6fb30","year":2022},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:14.750172Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:3c50cdfe98ea4867e89846115c6f9bdc09c6d237ef7a207de1475a09ff78bdb6","observation_id":"7dc4a628-7d37-4859-93f2-ed463caf19e9","resolution":{"observed_at":"2026-08-07T12:54:17.365638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:17.105538Z","title":"IEMOCAP: interactive emotional dyadic motion capture database,","venue":null,"work_id":"6e78497c-5960-467a-9a9d-33699ce2cb03","year":2008},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:14.880607Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:dc915ab79600efeeedd14dd09f3a7fbc5aee69efcd6c48db0821c058e561fb93","observation_id":"b489156c-9c89-4357-979e-e40cfd8ed274","resolution":{"observed_at":"2026-08-07T12:54:17.207672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:16.941107Z","title":"Meld: A multimodal multi-party dataset for emo- tion recognition in conversations,","venue":null,"work_id":"ed7ac67d-5358-4ebf-8416-96fcf182263c","year":2018},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:14.959046Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:9dabdb6111a45abe006a0440c84f2b6e2567e7dd7fae0d9361fdbd7c5235fd6f","observation_id":"e7b0602d-a9fc-4964-902c-23ed82a8486f","resolution":{"observed_at":"2026-08-07T12:54:17.009952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:16.747694Z","title":"Emobox: Multilingual multi-corpus speech emotion recognition toolkit and benchmark,","venue":null,"work_id":"e0555a16-31f6-4ced-a0f0-f8306ffddda3","year":2024},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:15.042727Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:f436c327d8db24759490c51dd72efe5bc0bdb2067a8a0d71fc891a4f2f02573f","observation_id":"55dd8869-81ed-4273-ad07-36cb3b9553fc","resolution":{"observed_at":"2026-08-07T12:54:16.836603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:24.138279Z","title":"Disentanglement network: Disentangle the emo- tional features from acoustic features for speech emotion recogni- tion,","venue":null,"work_id":"b792f5f6-a339-4688-b9ea-17c614b2d4f3","year":2024},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:15.161492Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:9e83bb47d26bfe2ca4aa1f47e232e190fc1e9869e57a505ce1000bb71875387a","observation_id":"d0bcd29b-7652-4683-b49b-bea1efd68a1f","resolution":{"observed_at":"2026-08-07T12:54:24.246200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:16.566667Z","title":"How first-and second-language emotion words influence emotion perception in swedish–english bilinguals,","venue":null,"work_id":"9fe579d0-5f91-4222-ad92-7a1dc7ac9089","year":2022},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:15.268678Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:cbe5f8d0ccd8c339d37d8659f4c83e6ffaa45bd8ca8a2949f8696e7f10795b02","observation_id":"d661b436-49a3-4fa5-b7e8-336b0f139d53","resolution":{"observed_at":"2026-08-07T12:54:16.649505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:16.368320Z","title":"Blsp-emo: Towards empathetic large speech- language models,","venue":null,"work_id":"29d5b306-70dd-4b62-82ac-5426713237d9","year":2024},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:15.380851Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:5f6cad2436ff28d02b3a203fb2f5f0c084d1afc49497c5bc2834f2038ab476b1","observation_id":"23b390d3-f5b6-48f9-9638-6921520dae5b","resolution":{"observed_at":"2026-08-07T12:54:16.469881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:22.407638Z","title":"Speech emotion recognition using decomposed speech via multi-task learning,","venue":null,"work_id":"a656ddae-30ce-481e-81a0-9bd1575f088a","year":2023},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:15.507673Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:cdab51eefe021a1621045697075b2a99382d06a8b19d63c2e25a70c332cf116b","observation_id":"7775b9ca-23b7-4ccc-ba9a-e560c35769ab","resolution":{"observed_at":"2026-08-07T12:54:22.505430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:16.171897Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":"9bfa033a-2f15-44a9-8516-11ab4ffeeba5","year":2022},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:15.581933Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:5ba430beb3c852c2511fe37d7afcd20602ac0f1a2bca065ab71c50827aa8ee6c","observation_id":"4e7d8c3a-de36-4af3-985c-fc9407c83a38","resolution":{"observed_at":"2026-08-07T12:54:16.263774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:16.021226Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":"b9206625-15ae-4ecc-a60d-78b4e7dfbbc7","year":2020},"citing_paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:15.683108Z"},"links":{"citing_paper":"/paper/2505.23236"},"observation_digest":"sha256:d61cf61ad5ad87ae08891a50338e140535a011d553377c791546fbc969bc435f","observation_id":"5c07f64d-df15-40c4-9fa8-2de47749a25f","resolution":{"observed_at":"2026-08-07T12:54:16.098034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23236","last_updated":"2025-05-29T08:36:28Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T12:47:43.038975Z","submitted_at":"2025-05-29T08:36:28Z","title":"Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":1,"verified_fuzzy":53},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 1 inbound Pith citation observation for arXiv:2505.23236."}