{"as_of":"2026-08-09T06:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ee45dfaa2cd08ffb2a359bd6da0495e5602499657c39b080de07961b5c35f9b4","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T01:53:00.127636Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.06611/citation-record","integrity":"/paper/2607.06611/integrity","json":"/paper/2607.06611/citation-record.json","paper":"/paper/2607.06611"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:48.916768Z","title":"The evolution of sentiment analysis and conversational AI: Techniques applications and future research directions","venue":null,"work_id":"60da4b85-7bde-4ec8-be7e-7741167102e5","year":2025},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:05de258111551b562cbed4dfe3df98a3ca6b5ae108d5710a69d0ea8c1a713090","observation_id":"7f693040-bd69-46b8-ae57-62bf2b178b88","resolution":{"observed_at":"2026-07-11T02:07:48.942291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:48.857357Z","title":"Sentiment analysis and emotion recognition from speech using universal speech representations","venue":null,"work_id":"bd022174-cc95-4b41-bc18-0dc2c1cfd251","year":2022},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:edde8aa727f5827e3b3db76b9b5d1585c94c8078a8b09da1fba7777dec0179f4","observation_id":"c797137c-7de2-4edd-ae15-66f2ec2735aa","resolution":{"observed_at":"2026-07-11T02:07:48.881121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:48.672741Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations, in: Proceedings of NeurIPS, pp","venue":null,"work_id":"6ad395f7-4be6-497a-9dbb-85401558bcdb","year":2020},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:68e3c0928052edba1acb20f339025788546889ae24560a3b3c871cabe6191a29","observation_id":"f07b8f8e-8391-4d93-8498-6176ad613e87","resolution":{"observed_at":"2026-07-11T02:07:48.703203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:48.316867Z","title":"TweetEval: Unified benchmark and comparative evaluation for tweet classification, in: Findings of EMNLP, pp","venue":null,"work_id":"d2bbf640-9ec4-4981-8d5f-c8c28325620e","year":2020},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:c4f2ac2ea36bcf3827bc2c3eba3b80dea7657884e9af3bc8b2bcd0f537bb3217","observation_id":"d21193c9-b6e7-431c-bbec-bdcb507027ae","resolution":{"observed_at":"2026-07-11T02:07:48.341409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:48.597874Z","title":"Sentiment Analysis of Customer Feedback and Reviews in E-Commerce Systems, in: Proceedings of ICTCS, pp","venue":null,"work_id":"3a22a352-4fc4-48c4-810a-7d017a1d6e72","year":2025},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:0c79b25af520d39bbfa9c43353247c7d7960a681d75f9b02060c9100445280da","observation_id":"1e7a7188-cd28-45ff-9ddc-32c0a3f60164","resolution":{"observed_at":"2026-07-11T02:07:48.623963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:48.980826Z","title":"IEMOCAP: Interactive emotional dyadic motion capture database","venue":null,"work_id":"40750a54-58a8-4f51-80fe-d524050331ce","year":2008},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:696a9c770ee0221226d4c56f25b7741ec3345fae40aeecc799b5b5ea5f0be49d","observation_id":"9f5f687a-49a2-4fcc-beff-cb3be8a79c5b","resolution":{"observed_at":"2026-07-11T02:07:49.008905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09791","last_updated":"2025-09-11T18:51:58Z","snapshot_observed_at":"2026-08-08T06:22:12.517525Z","submitted_at":"2025-09-11T18:51:58Z","title":"The MSP-Podcast Corpus","version":1},"cited_work":{"arxiv_id":"2509.09791","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.09791","snapshot_observed_at":"2026-07-11T01:57:52.098079Z","title":"The msp-podcast corpus","venue":"eess.AS","work_id":"8f208ac9-5500-4c6f-bfdb-83056c337610","year":2025},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"cited_paper":"/paper/2509.09791","citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:b5dac9d2a3085237f8c5beb80dbc55d0bf3858bcd5285c1d5b4ee5e8fe97699d","observation_id":"6bf36bf0-23ef-4bd0-a977-ea0adbef5d99","resolution":{"observed_at":"2026-07-11T01:57:52.125343Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:48.536547Z","title":"German’s next language model, in: Proceedings of COLING, pp","venue":null,"work_id":"4dae95b5-e2c3-4794-a960-6fd60b21c5fd","year":2020},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:a0095bd9469b040e241bc62052f3b7c9768a2b00b082248a2dcfe740c325f105","observation_id":"5581cd06-56bc-48e7-a1d8-cc58f3a6080f","resolution":{"observed_at":"2026-07-11T02:07:48.561625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.511004Z","title":"WavLM: Large-Scale Self-Supervised Pre-Training for Full Stack Speech Processing","venue":null,"work_id":"4bc1c371-fde6-4430-b855-1e977f9ccd6c","year":2022},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:656f741d960d79489218ea48829360a38c8923eb60cf2999c1a2428a94495f76","observation_id":"639c29ce-3311-40e5-ac9e-dc5278c8b5b3","resolution":{"observed_at":"2026-07-11T02:07:49.538198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.542119Z","title":"BERT: Pre-training of deep bidirectional transformers for language understanding, in: Proceedings of NAACT-HLT, pp","venue":null,"work_id":"1bcfd91e-227b-461e-bbd9-4f2e785a5c98","year":2019},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:95312388c3abac58bd14fbe8ad4de12fadccfdfd2b06890c3b175cd49b747e66","observation_id":"b7b2eaf5-d8ad-4360-9fbb-d7fe89dfd425","resolution":{"observed_at":"2026-07-11T02:07:49.571023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.574803Z","title":"Optimized Sentiment Analysis in Tagalog Speech Using PCA and BRNN on Prosodic Suprasegmental and MFCC Features, in: Proceedings of ICTC, pp","venue":null,"work_id":"6bc0cb35-7db0-42a8-8cbf-65aa18929ca9","year":2024},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:031645fa20adcde887de95192ca75e218f08c8cdcbdfbbacc1b3f9cd8aaa180e","observation_id":"0f7eca62-d1b6-4a2c-ab23-17fd0297fd19","resolution":{"observed_at":"2026-07-11T02:07:49.601183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:48.378329Z","title":"A review on speech emotion recognition: A survey, recent advances, challenges, and the influence of noise","venue":null,"work_id":"343986d8-3212-4448-b837-d5ef34c0ea07","year":2024},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:f21c9a815b21ac11e089567502ba74df6b5b47eb34d0df5b628325886f999dde","observation_id":"0f0b3717-bb94-4ffc-aecc-b9e4d329bfec","resolution":{"observed_at":"2026-07-11T02:07:48.404930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.700239Z","title":"Teacher-Student Training and Triplet Loss for Facial Expression Recognition under Occlusion, in: Proceedings of ICPR, pp","venue":null,"work_id":"989d293c-ef5e-4910-ada3-f892d4427797","year":2020},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:3d39ec8a76f0f3c96173afee0b98a81441182b6d0718217337c8ed1e3100fc21","observation_id":"cdeb7a1d-0ee1-46fa-9d83-315bb24b73f7","resolution":{"observed_at":"2026-07-11T02:07:49.726874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:48.918230Z","title":"AST: Audio Spectrogram Transformer, in: Proceedings of INTERSPEECH, pp","venue":null,"work_id":"08dad181-5f5b-4e80-99e2-aa9ffdf9f0ac","year":2021},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:63c8decd7493eedbe627db7f8e483765811f6fe9dd9c0f199f4ce24aade6d6df","observation_id":"7e0b00e8-8c0e-40c6-acd1-5426bd551698","resolution":{"observed_at":"2026-07-11T02:07:48.944100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":"1503.02531","doi":"10.1109/cvpr52733.2024.01515","metadata_source":"pith","pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Distilling the Knowledge in a Neural Network","venue":"stat.ML","work_id":"d927ab1f-17b8-4002-9d09-c3d55764fbad","year":2015},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:76d98a6ce115f49ebf43d0337bbeaf54ea9c0b494338b89d428acee5f00bfa12","observation_id":"173827fc-beb8-4ce7-b67f-01a05ee034c6","resolution":{"observed_at":"2026-07-11T01:57:52.151963Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.326760Z","title":"HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units","venue":null,"work_id":"2b3f7efb-0bbf-42c5-bf90-0442e23e6ecf","year":2021},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:8e192e739b0b16be9f7d9cf7428a2b7cd0286d0246c86deae26a7b8a6c4c9c22","observation_id":"fc45812c-5ef5-406c-bc89-7e90096498fc","resolution":{"observed_at":"2026-07-11T02:07:49.352399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.356454Z","title":"LoRA: Low-Rank Adaptation of Large Language Models, in: Proceedings of ICLR","venue":null,"work_id":"f2f26e26-d3dc-45a0-9bbf-d8c23c15171e","year":2022},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:775bf9b971e385b9777c9b71e1972b2fc28cbe97ccec054f5a66b1543da1d0b4","observation_id":"c9ae9372-df68-4ce1-ac83-bdbdeda3aba4","resolution":{"observed_at":"2026-07-11T02:07:49.383973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.446546Z","title":"Conditional Variational Autoencoder with Adversarial Learning for End-to-End Text-to-Speech, in: Pro- ceedings of ICML, pp","venue":null,"work_id":"1a971fb8-40c8-48f5-9bef-18282fec95a9","year":2021},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:e79051f15d00308aad905ca360e120c4216366cf651cf5b667f8fae2f9c37d7f","observation_id":"44ae0fd6-1df5-4da5-99f2-d10fdf2153b6","resolution":{"observed_at":"2026-07-11T02:07:49.474514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.359852Z","title":"faster-whisper: Faster Whisper transcription with CTranslate2.https://github.com/SYSTRAN/faster-whisper","venue":null,"work_id":"682412ca-39bd-4541-aa9c-ecac9b9426f3","year":2023},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:bd189aa3e556b4f375feb5497d78356e640326dc6a31cb1e5849284af274dc81","observation_id":"2daecc1d-f41f-4b82-973e-41c02b5f2660","resolution":{"observed_at":"2026-07-11T02:07:49.381658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:48.536176Z","title":"Incorporating end-to-end speech recognition models for sentiment analysis, in: Proceedings of ICRA, pp","venue":null,"work_id":"245a2902-9fb5-41b0-824f-63d19dbacf36","year":2019},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:237509a1e914b6b0e8fca8a962ed5e3134fc15dcf308591918cd5996f66db87a","observation_id":"b98508a2-01cb-49c5-bd1f-3374212a27c6","resolution":{"observed_at":"2026-07-11T02:07:48.562121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.384730Z","title":"Unimodal-driven distillation in multimodal emotion recognition with dynamic fusion, in: Proceedings of ICME, pp","venue":null,"work_id":"62f25664-4fb2-4581-add2-d426b282befb","year":2025},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:26ea1956d4a9e867ebc66c0b51f03aa30b43b949217772b2465b835de5061b1a","observation_id":"7a028ca4-f932-4d96-92e0-96691cde939e","resolution":{"observed_at":"2026-07-11T02:07:49.410591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.236265Z","title":"Speech Emotion Recognition With ASR Transcripts: a Comprehensive Study on Word Error Rate and Fusion Techniques, in: Proceedings of SLT, pp","venue":null,"work_id":"ebd1952f-5749-4261-a3f6-55ebf37052cd","year":2024},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:f130e3e70fa6fdd92f59b2c0e8a4db8b219eabcba6119f52310b636924c45d63","observation_id":"5bd5a4c2-13a7-4ecd-ac3f-a003d5b00c58","resolution":{"observed_at":"2026-07-11T02:07:49.261230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.295213Z","title":"Decoupled multimodal distilling for emotion recognition, in: Proceedings of CVPR, pp","venue":null,"work_id":"e995e539-b087-4a35-a006-e30e1c52d1df","year":2023},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:28f4e59fc2ea9531354850a71397397281371a9d5271a0caef2e206c19da0ed4","observation_id":"8ac18c4f-f752-4748-87f7-d42d163a878e","resolution":{"observed_at":"2026-07-11T02:07:49.322770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.480434Z","title":"A survey of deep learning-based multimodal emotion recognition: Speech, text, and face","venue":null,"work_id":"9813f4a9-bf2c-4720-b47c-7e6e1a124926","year":2023},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:eb8126e2b373a1e8faf1ace2c25e43217c729574cfaf8f2e7585552b5f66e531","observation_id":"3aea66e4-3850-4ebb-9bcd-e5852175771b","resolution":{"observed_at":"2026-07-11T02:07:49.507364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.413609Z","title":"Development of interactive English e-learning video entertainment teaching environment based on virtual reality and game teaching emotion analysis","venue":null,"work_id":"cfb2d034-be15-4279-807a-84580290bb1c","year":2025},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:c0f2b6ddf7013c0d03bc4560799a57e3df6152d3a7f83a711b05b13a07d2ebd5","observation_id":"2ebb9d24-e0ba-4c28-9175-b8ad767de9a0","resolution":{"observed_at":"2026-07-11T02:07:49.435195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:48.700713Z","title":"Unifying distillation and privileged information, in: Proceedings of ICLR","venue":null,"work_id":"bba2722a-1e5d-4f51-a2ec-9efab6d8deea","year":2016},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:e498abb4911758bb1874257c7964f961482f8e06956f6d65653a61f9d1e2c694","observation_id":"470f6a7e-e1b9-4267-a186-e558dc4a4df9","resolution":{"observed_at":"2026-07-11T02:07:48.727337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.01368","last_updated":"2021-12-02T16:09:33Z","snapshot_observed_at":"2026-08-03T21:34:51.089550Z","submitted_at":"2021-12-02T16:09:33Z","title":"ScaleVLAD: Improving Multimodal Sentiment Analysis via Multi-Scale Fusion of Locally Descriptors","version":1},"cited_work":{"arxiv_id":"2112.01368","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.01368","snapshot_observed_at":"2026-07-11T01:57:52.086922Z","title":"Scalevlad: Improving multimodal sentiment analysis via multi-scale fusion of locally descriptors","venue":"cs.CL","work_id":"c959913a-ae0e-4026-b864-83a96f323037","year":2021},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"cited_paper":"/paper/2112.01368","citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:ba34e6efe7b5e813bf7379c9895ec2dcc277f0ce5b3e9b08dcb5eaf90775f117","observation_id":"ffdce282-5df0-4fcb-bfb4-1c1f1d883b29","resolution":{"observed_at":"2026-07-11T01:57:52.113290Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.067297Z","title":"Audio sentiment analysis by heterogeneous signal features learned from utterance-based parallel neural network, in: Proceedings of AffCon@AAAI, pp","venue":null,"work_id":"4866b481-5da6-4872-99f2-6addcd30bb8d","year":2019},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:cfb335dcd1106e8507d7e8d3c925f7022dce7276a6b1c968912a33c106e5da9d","observation_id":"becdda28-330f-4f03-83d9-c406ffb7824f","resolution":{"observed_at":"2026-07-11T02:07:49.096140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.332483Z","title":"CamemBERT: a tasty French language model, in: Proceedings of ACL, pp","venue":null,"work_id":"45e29cf2-6cfa-4bbc-b871-af0f14163cb4","year":2020},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:0e6395c5be78e7d57d4f108d1564f51331ce3b35f993b79638801789e4addf91","observation_id":"ffef5c22-058d-4bc6-b934-a8361559a09d","resolution":{"observed_at":"2026-07-11T02:07:49.356234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.305898Z","title":"Learning using generated privileged information by text-to-image diffusion models, in: Proceedings of ICPR, pp","venue":null,"work_id":"0b0d6fb0-3ea6-47b8-91c2-74ae27e2e5c8","year":2024},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:be3df1eb66137c6951dffcf2df22f170f730c7a325ad638bf5ee2abc61999b95","observation_id":"b74604ae-6a73-4ab8-b296-85bad7aa1bed","resolution":{"observed_at":"2026-07-11T02:07:49.328815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:48.857472Z","title":"Verbal sentiment analysis and detection using recurrent neural network, in: Advanced Data Mining Tools and Methods for Social Computing","venue":null,"work_id":"e6abbe64-3d6d-49cc-951f-1887f62a6403","year":2022},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:8a22230c6ecbf87210dec604ade16a2cf568ecbe84446e5f572264c1d3a2f806","observation_id":"9d77120e-2752-4f43-a185-3bdf66a764c7","resolution":{"observed_at":"2026-07-11T02:07:48.882398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03000","last_updated":"2024-01-04T22:42:14Z","snapshot_observed_at":"2026-07-06T17:12:06.715778Z","submitted_at":"2024-01-04T22:42:14Z","title":"Bridging Modalities: Knowledge Distillation and Masked Training for Translating Multi-Modal Emotion Recognition to Uni-Modal, Speech-Only Emotion Recognition","version":1},"cited_work":{"arxiv_id":"2401.03000","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.03000","snapshot_observed_at":"2026-07-11T01:57:52.008800Z","title":"Bridging Modalities: Knowledge Distillation and Masked Training for Translating Multi-Modal Emotion Recognition to Uni-Modal, Speech-Only Emotion Recognition","venue":"cs.SD","work_id":"0118e0c6-52fb-4257-b793-1cafbbba7918","year":2024},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"cited_paper":"/paper/2401.03000","citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:f728128416d9241f09a8aa92c99d6bb1c505104fb916550836a6bcbf7a8bd5f5","observation_id":"5c34b6f5-2a3b-4f4d-af1c-0af8fd4e45ba","resolution":{"observed_at":"2026-07-11T01:57:52.031561Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.146180Z","title":null,"venue":null,"work_id":"d33c3ab4-e820-4c37-bfb7-5bf1824e122e","year":null},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:02de9704a0568ee39c62d02205e21cbbb921ff869c8d3c616b1a93146395f9df","observation_id":"bfaf5578-4fc6-4d6f-8a12-8647fb491780","resolution":{"observed_at":"2026-07-11T02:07:49.174874Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:48.409367Z","title":"4668–4672","venue":null,"work_id":"ba3d1c5b-ee09-43d9-90d6-fce398fb7d38","year":2025},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:443153666e90d814c0e53005aa3ea4aff8490417b45e7e972ba3e3e898bd6dfc","observation_id":"7fcf8860-9b95-48d0-8dcb-d715a2158b6e","resolution":{"observed_at":"2026-07-11T02:07:48.433904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04672","last_updated":"2022-08-25T17:10:53Z","snapshot_observed_at":"2026-07-06T13:29:47.927628Z","submitted_at":"2022-07-11T07:33:36Z","title":"No Language Left Behind: Scaling Human-Centered Machine Translation","version":3},"cited_work":{"arxiv_id":"2207.04672","doi":"10.18653/v1/w19-5207","metadata_source":"pith","pith_arxiv_id":"2207.04672","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"No Language Left Behind: Scaling Human-Centered Machine Translation","venue":"cs.CL","work_id":"68c8336c-d20e-40fa-ba9c-89459da6fc1a","year":2022},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"cited_paper":"/paper/2207.04672","citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:64f05fa20cacd27eb7d80fe4c168341d7b605730095a034c74bd567fe33eddd4","observation_id":"8adb56cc-3895-4df3-8298-bf67eef50be9","resolution":{"observed_at":"2026-07-11T01:57:52.159386Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.010485Z","title":"RoBERTuito: a pre-trained language model for social media text in Spanish, in: Proceedings of LREC, pp","venue":null,"work_id":"fe33b0ad-221c-4ef8-9afe-0081cb9460f2","year":2022},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:049088d129b8523bf809a48a0cee6448ff8bc7c5eb3437340c37ffd7773f9af6","observation_id":"e3810431-9f63-4532-bbbb-7601d50ccc77","resolution":{"observed_at":"2026-07-11T02:07:49.034169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.100021Z","title":"MELD: A Multimodal Multi-Party Dataset for Emotion Recognition in Conversations, in: Proceedings of ACL, pp","venue":null,"work_id":"de81e701-b5af-4e6a-86a6-99bbd4f1d40e","year":2019},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:1bde5886b84d7e42ade9cae0c78e52440447c2dc8275935f089ffeaee47a002e","observation_id":"f4e197aa-3d68-4436-b2cc-caa9b2cea59c","resolution":{"observed_at":"2026-07-11T02:07:49.133028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.174748Z","title":"Scaling speech technology to 1,000+languages","venue":null,"work_id":"31981a1f-8a90-480e-bcf8-c9826b778ab3","year":2024},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:99406433eb0541071a456097cbd817f4923160c2a640f508b4dc16b74fd2c729","observation_id":"31401229-8535-41aa-abe5-79ab315dbe2a","resolution":{"observed_at":"2026-07-11T02:07:49.201643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.418844Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision, in: Proceedings of ICML, pp","venue":null,"work_id":"14e8be83-14e7-429e-95be-0f9d4c1d472f","year":2023},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:844c1549f9fc99a4209be6a187c30dcfabd244aae2bf69f1669ad3ca931ed938","observation_id":"2b27edf8-5f60-414a-839d-285db828943c","resolution":{"observed_at":"2026-07-11T02:07:49.443273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.668958Z","title":"Cascaded cross-modal transformer for audio-textual classification","venue":null,"work_id":"e223a0ae-9dbd-473d-9863-faaf74931e45","year":2024},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:81a07d7c061da4e71234ac70ed60fde7ad0dc1d04d99e6497eb9425a7b74ed4d","observation_id":"7687e83f-2f1a-478f-8084-fbcba3c8d3b2","resolution":{"observed_at":"2026-07-11T02:07:49.696578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:48.765679Z","title":"Cascaded cross-modal transformer for request and complaint detection, in: Proceedings of ACMMM, pp","venue":null,"work_id":"a81970fa-dfb7-44bb-a7f7-b5a30c1419e5","year":2023},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:1c4dbd310ca63196aaed3486b58f5faa057218fa6f20a16d8bfb1bb96fcf0b70","observation_id":"17fe5ee7-83eb-411a-814d-bb49c472a88e","resolution":{"observed_at":"2026-07-11T02:07:48.792233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.730374Z","title":"SepTr: Separable Transformer for Audio Spectrogram Processing, in: Proceedings of INTER- SPEECH, pp","venue":null,"work_id":"cabc75f4-aa86-45db-a339-2c1c017596e2","year":2022},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:6a97e517637fa71d36f736ee52440c956f2f621cbb9b927136bd8bcae64710e3","observation_id":"f3cdb596-e0bf-4499-b398-13ab84f207f4","resolution":{"observed_at":"2026-07-11T02:07:49.758610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:48.634952Z","title":"An integrated approach for mental health assessment using emotion analysis and scales","venue":null,"work_id":"60c6e558-12df-45b4-a679-588aed2b43da","year":2025},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:0546911855cdbda794a37f3db9692e7b4c6749a13e501f9712657d6e31e60cb4","observation_id":"050246b2-a0f1-436a-8777-1513cb80f3a5","resolution":{"observed_at":"2026-07-11T02:07:48.665945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.249179Z","title":"Leveraging pre-trained language model for speech sentiment analysis, in: Proceedings of INTERSPEECH, pp","venue":null,"work_id":"63217d6f-cc94-44f8-812b-b5317379c7a4","year":2021},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:3dd979ee81d737ac17c1a4f469ed163b46de45397e6191eca83da08a58d441d4","observation_id":"13152bb5-235f-490d-a9b3-8ff72df03477","resolution":{"observed_at":"2026-07-11T02:07:49.276886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.112719Z","title":"A comparative study on Bengali speech sentiment analysis based on audio data, in: Proceedings of BigComp, pp","venue":null,"work_id":"83469442-8965-4442-bbb9-719c5726f37d","year":2023},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:0bd384af1ec5dcf3f74b0f9244bdb5acea0bdd273b97886224b5b8712ad0c899","observation_id":"9a154783-b248-45ab-9fcc-c64df45744a8","resolution":{"observed_at":"2026-07-11T02:07:49.142487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.076207Z","title":"Multimodal transformer for unaligned multimodal language sequences, in: Proceedings of ACL, pp","venue":null,"work_id":"00acaccb-e666-4f69-a0bf-86c9dcdda2c6","year":2019},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:1f4b2016fa002adc39787b1b69a9eaea80a483d21d172580f8dea4db378243c7","observation_id":"3ad7cd62-36fd-4bd7-8197-18dbb4cbf17d","resolution":{"observed_at":"2026-07-11T02:07:49.106555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:48.885973Z","title":"Hierarchical cross-modal attention and dual audio pathways for enhanced multimodal sentiment analysis","venue":null,"work_id":"cc561afd-478d-48cc-9a26-09ebfb971967","year":2025},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:3b428bfd00102ce7c66a9ee5f6e43ae6cc1db802a19a132a5a760f2f88e081f6","observation_id":"d4331dbd-6328-40ab-8fa6-2c0ad0ab1bc1","resolution":{"observed_at":"2026-07-11T02:07:48.912555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.219045Z","title":"Learning using privileged information: Similarity control and knowledge transfer","venue":null,"work_id":"b50c4914-6cd0-44bc-bd7e-8e837e3dd0db","year":2015},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:995fe0dad249e84c95b8a1a8c9966c2763d360ce300488c7521ffe59f4f6a4c8","observation_id":"d41049fb-4d5a-4183-8be6-3675fee23ca4","resolution":{"observed_at":"2026-07-11T02:07:49.245218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02735","last_updated":"2022-10-03T20:50:54Z","snapshot_observed_at":"2026-07-06T12:05:22.076764Z","submitted_at":"2021-11-04T10:39:06Z","title":"A Fine-tuned Wav2vec 2.0/HuBERT Benchmark For Speech Emotion Recognition, Speaker Verification and Spoken Language Understanding","version":3},"cited_work":{"arxiv_id":"2111.02735","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.02735","snapshot_observed_at":"2026-07-11T01:57:52.037436Z","title":"A fine-tuned wav2vec 2.0/hubert benchmark for speech emotion recognition, speaker verification and spoken language understanding","venue":"cs.CL","work_id":"6bb9f860-e45b-4ceb-8ca3-17d38124e800","year":2021},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"cited_paper":"/paper/2111.02735","citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:f4706dfe476fffd08c76eb6f30991812361b555c636ced058e332090c1a399ee","observation_id":"2b030a15-2b87-45b2-8590-d35b6fbd9979","resolution":{"observed_at":"2026-07-11T01:57:52.061776Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.636611Z","title":"Enriching multimodal sentiment analysis through textual emotional descriptions of visual-audio content, in: Proceedings of AAAI, pp","venue":null,"work_id":"d0620114-5bb5-4af0-81a4-4635f869e29f","year":2025},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:b86ea79c36a824c07cb8a090a645c62a6048b148295440e2be7a04c7ffccdde9","observation_id":"55ee1f27-4db3-4afe-ac07-226c743311bf","resolution":{"observed_at":"2026-07-11T02:07:49.664775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.11772","last_updated":"2022-11-12T13:05:28Z","snapshot_observed_at":"2026-08-03T13:30:54.515603Z","submitted_at":"2022-11-12T13:05:28Z","title":"A Self-Adjusting Fusion Representation Learning Model for Unaligned Text-Audio Sequences","version":1},"cited_work":{"arxiv_id":"2212.11772","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.11772","snapshot_observed_at":"2026-07-11T01:57:52.068493Z","title":"A Self-Adjusting Fusion Representation Learning Model for Unaligned Text-Audio Sequences","venue":"cs.CL","work_id":"6ae9c2cd-7ca1-4085-904c-81e1d0c46703","year":2022},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"cited_paper":"/paper/2212.11772","citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:ee5b413894b8c1ede31b0d394d3337ebc0a83c0bd3897ae41cb9944266f5196f","observation_id":"53ca2bb2-41f4-4adb-9b3f-f91edeec52d4","resolution":{"observed_at":"2026-07-11T01:57:52.092558Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.280832Z","title":"Multimodal speech emotion recognition using audio and text, in: Proceedings of SLT, pp","venue":null,"work_id":"297640ed-0a38-4558-8e95-60733ba1e457","year":2018},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:04fd4433dd1b15bcfd4acf9ddb7e7a1e25de573e2e68e8b5aae00e06366553f4","observation_id":"d1bbf595-ef6c-43fa-a12b-4ec23e26d35b","resolution":{"observed_at":"2026-07-11T02:07:49.302756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.605953Z","title":"Personality-aware multimodal driver emotion recognition towards intelligent connected vehicles","venue":null,"work_id":"75bb25b6-c089-4b01-bb01-da97e693c1b1","year":2026},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:ea9d66570e522a6353a6d83e1341e6cb0fd02f2dbfa72de8a54c1becbba4a528","observation_id":"7c0dee6f-1b7b-4c3b-971c-47b38a7c9102","resolution":{"observed_at":"2026-07-11T02:07:49.632327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":7,"verified_fuzzy":45},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2607.06611."}