{"as_of":"2026-08-20T16:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8423bddb065545306b55850391c56db13c8d5648fd25f78b66b33f74c363bf1e","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:59:33.025292Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.04642/citation-record","integrity":"/paper/2505.04642/integrity","json":"/paper/2505.04642/citation-record.json","paper":"/paper/2505.04642"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:33.405339Z","title":"A review of affective computing: From unimodal analysis to multimodal fusion,","venue":null,"work_id":"ff400bf9-157f-4e7c-9dc1-9ad25e582ac9","year":2017},"citing_paper":{"arxiv_id":"2505.04642","last_updated":"2025-05-05T02:31:11Z","snapshot_observed_at":"2026-08-20T03:34:59.212344Z","submitted_at":"2025-05-05T02:31:11Z","title":"Rethinking Multimodal Sentiment Analysis: A High-Accuracy, Simplified Fusion Architecture","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:32.903673Z"},"links":{"citing_paper":"/paper/2505.04642"},"observation_digest":"sha256:61b2c49a91ca64b8cf8d79b245952560a17cba195303fd845c941ba735b23062","observation_id":"11e5c12d-45ff-4d21-97e0-5f3cf3cc4e1f","resolution":{"observed_at":"2026-08-16T00:59:33.409665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:33.392113Z","title":"IEMOCAP: Interactive emotional dyadic motion capture database,","venue":null,"work_id":"aedeb81f-b052-4bd1-9ab5-dd329867b3b0","year":2008},"citing_paper":{"arxiv_id":"2505.04642","last_updated":"2025-05-05T02:31:11Z","snapshot_observed_at":"2026-08-20T03:34:59.212344Z","submitted_at":"2025-05-05T02:31:11Z","title":"Rethinking Multimodal Sentiment Analysis: A High-Accuracy, Simplified Fusion Architecture","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:32.909241Z"},"links":{"citing_paper":"/paper/2505.04642"},"observation_digest":"sha256:8d12ae2e6617da6ea6acef738f574baba431fb17c0cf91bb82a532b66024aa27","observation_id":"496881d0-19ea-4d58-a71e-76b7f39a5b8d","resolution":{"observed_at":"2026-08-16T00:59:33.396541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:33.379258Z","title":"Memory fusion network for multi-view sequential learning,","venue":null,"work_id":"99fe541a-05a7-43f4-a5cb-72b04a4d43b0","year":2018},"citing_paper":{"arxiv_id":"2505.04642","last_updated":"2025-05-05T02:31:11Z","snapshot_observed_at":"2026-08-20T03:34:59.212344Z","submitted_at":"2025-05-05T02:31:11Z","title":"Rethinking Multimodal Sentiment Analysis: A High-Accuracy, Simplified Fusion Architecture","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:32.913892Z"},"links":{"citing_paper":"/paper/2505.04642"},"observation_digest":"sha256:62b21f1870e08fae076bf3c319d9a04900e2e2f5c8e52a4524a30e5bb71a41bd","observation_id":"7ee8c013-3369-46f2-aa7c-86e375e49ebe","resolution":{"observed_at":"2026-08-16T00:59:33.383576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:33.365395Z","title":"Attention is all you need,","venue":null,"work_id":"f7c7d700-ce1a-47ef-8ba7-efc168375644","year":2017},"citing_paper":{"arxiv_id":"2505.04642","last_updated":"2025-05-05T02:31:11Z","snapshot_observed_at":"2026-08-20T03:34:59.212344Z","submitted_at":"2025-05-05T02:31:11Z","title":"Rethinking Multimodal Sentiment Analysis: A High-Accuracy, Simplified Fusion Architecture","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:32.918814Z"},"links":{"citing_paper":"/paper/2505.04642"},"observation_digest":"sha256:2b8f5e4cadf84152e8d8198861e5c0b93944008d927766d105d8d288766b4568","observation_id":"7f6e6fe6-9c79-453e-9830-3240c0ad1267","resolution":{"observed_at":"2026-08-16T00:59:33.370467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:33.351516Z","title":"On the efficiency of multimodal architectures: A case study in sentiment analysis,","venue":null,"work_id":"c933df99-eb9a-4a96-b419-5abb97f28054","year":2020},"citing_paper":{"arxiv_id":"2505.04642","last_updated":"2025-05-05T02:31:11Z","snapshot_observed_at":"2026-08-20T03:34:59.212344Z","submitted_at":"2025-05-05T02:31:11Z","title":"Rethinking Multimodal Sentiment Analysis: A High-Accuracy, Simplified Fusion Architecture","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:32.923760Z"},"links":{"citing_paper":"/paper/2505.04642"},"observation_digest":"sha256:d33dec9bdc4fa655d61502d158c900182a1ce413fc5c6f3a8d85f156b37b38dd","observation_id":"0a2b6eba-4c7c-454d-ae68-da66ba10927e","resolution":{"observed_at":"2026-08-16T00:59:33.355985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:33.336949Z","title":"Multimodal transformer for unaligned multimodal language sequences,","venue":null,"work_id":"9f75e426-67af-4981-93c2-886e8ec58b8f","year":2019},"citing_paper":{"arxiv_id":"2505.04642","last_updated":"2025-05-05T02:31:11Z","snapshot_observed_at":"2026-08-20T03:34:59.212344Z","submitted_at":"2025-05-05T02:31:11Z","title":"Rethinking Multimodal Sentiment Analysis: A High-Accuracy, Simplified Fusion Architecture","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:32.928440Z"},"links":{"citing_paper":"/paper/2505.04642"},"observation_digest":"sha256:f0872c1fb0f81eab99cd3c571048f7dad8e2565ffa04d75ee6735fe2cb0a378d","observation_id":"2b294721-c038-42df-aed4-6a4e72a9e46f","resolution":{"observed_at":"2026-08-16T00:59:33.342234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:33.323242Z","title":"Opinion mining and sentiment analysis,","venue":null,"work_id":"15a40804-84b1-4c0f-a70b-0df7ab0cb484","year":2008},"citing_paper":{"arxiv_id":"2505.04642","last_updated":"2025-05-05T02:31:11Z","snapshot_observed_at":"2026-08-20T03:34:59.212344Z","submitted_at":"2025-05-05T02:31:11Z","title":"Rethinking Multimodal Sentiment Analysis: A High-Accuracy, Simplified Fusion Architecture","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:32.934011Z"},"links":{"citing_paper":"/paper/2505.04642"},"observation_digest":"sha256:1e0a2061752084246d89bef7ca47d00e2ed12ca5ee3cba3a53e2a943b9999a0a","observation_id":"74bcd481-1232-4964-97e2-7fec72ebf5ca","resolution":{"observed_at":"2026-08-16T00:59:33.327835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:33.309624Z","title":"IEMOCAP: Interactive emotional dyadic motion capture database,","venue":null,"work_id":"eddf83d2-764a-4046-9b3c-24851b7b7eb4","year":2008},"citing_paper":{"arxiv_id":"2505.04642","last_updated":"2025-05-05T02:31:11Z","snapshot_observed_at":"2026-08-20T03:34:59.212344Z","submitted_at":"2025-05-05T02:31:11Z","title":"Rethinking Multimodal Sentiment Analysis: A High-Accuracy, Simplified Fusion Architecture","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:32.938669Z"},"links":{"citing_paper":"/paper/2505.04642"},"observation_digest":"sha256:b77f13641904e7fe1a6c213e5eb477e666d832737926946e694695f4c85bc8f2","observation_id":"b2513821-0f19-4525-919c-65f74c765c86","resolution":{"observed_at":"2026-08-16T00:59:33.314099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:33.295807Z","title":"Domain adaptation for large -scale sentiment classification: A deep learning approach,","venue":null,"work_id":"88629e0d-ecba-4e0a-8fb1-dd379e75a5b8","year":2011},"citing_paper":{"arxiv_id":"2505.04642","last_updated":"2025-05-05T02:31:11Z","snapshot_observed_at":"2026-08-20T03:34:59.212344Z","submitted_at":"2025-05-05T02:31:11Z","title":"Rethinking Multimodal Sentiment Analysis: A High-Accuracy, Simplified Fusion Architecture","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:32.943249Z"},"links":{"citing_paper":"/paper/2505.04642"},"observation_digest":"sha256:49ee11f14210624ca6f077618386bbf97c36b749774205e5624ad91e77504ebc","observation_id":"94f9193e-7c51-45d9-ae99-1c235ad63719","resolution":{"observed_at":"2026-08-16T00:59:33.300318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:33.281458Z","title":"Tensor fusion network for multimodal sentiment analysis,","venue":null,"work_id":"9b73a156-476d-4e2b-be03-7b7e61d826be","year":2017},"citing_paper":{"arxiv_id":"2505.04642","last_updated":"2025-05-05T02:31:11Z","snapshot_observed_at":"2026-08-20T03:34:59.212344Z","submitted_at":"2025-05-05T02:31:11Z","title":"Rethinking Multimodal Sentiment Analysis: A High-Accuracy, Simplified Fusion Architecture","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:32.947805Z"},"links":{"citing_paper":"/paper/2505.04642"},"observation_digest":"sha256:d56e8a840e097a90f6a5069a98697a48d332e93390f904bc627e4f584e543f17","observation_id":"c56cdbd8-c827-4751-830d-5543f7c286b9","resolution":{"observed_at":"2026-08-16T00:59:33.286452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:33.267520Z","title":"Multimodal transformer for unaligned multimodal language sequences,","venue":null,"work_id":"32b06623-357d-45f4-8331-63f08f7dcba8","year":2019},"citing_paper":{"arxiv_id":"2505.04642","last_updated":"2025-05-05T02:31:11Z","snapshot_observed_at":"2026-08-20T03:34:59.212344Z","submitted_at":"2025-05-05T02:31:11Z","title":"Rethinking Multimodal Sentiment Analysis: A High-Accuracy, Simplified Fusion Architecture","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:32.952259Z"},"links":{"citing_paper":"/paper/2505.04642"},"observation_digest":"sha256:f8fc8f82f34fbc28fdb295d206f2d047bd49613afc8868987ca40abd4a725ac5","observation_id":"299b4f50-2e41-4162-80fc-4fb4d9d79e6f","resolution":{"observed_at":"2026-08-16T00:59:33.272461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:33.240128Z","title":"The Stanford CoreNLP natural language processing toolkit,","venue":null,"work_id":"3b514f1e-1ef1-4678-afe2-8e627bcaf0ee","year":2014},"citing_paper":{"arxiv_id":"2505.04642","last_updated":"2025-05-05T02:31:11Z","snapshot_observed_at":"2026-08-20T03:34:59.212344Z","submitted_at":"2025-05-05T02:31:11Z","title":"Rethinking Multimodal Sentiment Analysis: A High-Accuracy, Simplified Fusion Architecture","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:32.966781Z"},"links":{"citing_paper":"/paper/2505.04642"},"observation_digest":"sha256:08a574bd7e26891342aa1aa656116428b1ac8339f27cb21988ac1f30f021dedf","observation_id":"fbabdcaa-01bf-49cc-b84e-99a9b5dd0646","resolution":{"observed_at":"2026-08-16T00:59:33.244543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:33.225557Z","title":"spaCy 2: Natural language understanding with Bloom embeddings, convolutional neural networks and incremental parsing,","venue":null,"work_id":"8e05abd8-3b9e-4752-b4e4-796e3ebb3313","year":2017},"citing_paper":{"arxiv_id":"2505.04642","last_updated":"2025-05-05T02:31:11Z","snapshot_observed_at":"2026-08-20T03:34:59.212344Z","submitted_at":"2025-05-05T02:31:11Z","title":"Rethinking Multimodal Sentiment Analysis: A High-Accuracy, Simplified Fusion Architecture","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:32.971392Z"},"links":{"citing_paper":"/paper/2505.04642"},"observation_digest":"sha256:2e42893daa8e76a9b37f0031563b046238287f85ef326e624ec7e3af74b51bb4","observation_id":"6747edcd-ded3-4b65-9f1d-9ccd347bbe18","resolution":{"observed_at":"2026-08-16T00:59:33.230935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:33.211611Z","title":"Audio Spectrogram Transformer: Transformer architecture for audio data representation,","venue":null,"work_id":"c1557dc0-ab84-4c01-ab0e-31fd0b98dc91","year":2021},"citing_paper":{"arxiv_id":"2505.04642","last_updated":"2025-05-05T02:31:11Z","snapshot_observed_at":"2026-08-20T03:34:59.212344Z","submitted_at":"2025-05-05T02:31:11Z","title":"Rethinking Multimodal Sentiment Analysis: A High-Accuracy, Simplified Fusion Architecture","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:32.975692Z"},"links":{"citing_paper":"/paper/2505.04642"},"observation_digest":"sha256:7f5493f57949cd70364d29ed8fde83354860e557a451fe0f263822f651108623","observation_id":"dfadfaa7-17f4-4af7-a5f6-d38cd8eb1e60","resolution":{"observed_at":"2026-08-16T00:59:33.216170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:33.197273Z","title":"Speech emotion recognition combining acoustic features and linguistic information in a hybrid SVM - Bayesian network architecture,","venue":null,"work_id":"dd5e13e0-e0d7-45c0-be8e-a63d86b0b12d","year":2004},"citing_paper":{"arxiv_id":"2505.04642","last_updated":"2025-05-05T02:31:11Z","snapshot_observed_at":"2026-08-20T03:34:59.212344Z","submitted_at":"2025-05-05T02:31:11Z","title":"Rethinking Multimodal Sentiment Analysis: A High-Accuracy, Simplified Fusion Architecture","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:32.980057Z"},"links":{"citing_paper":"/paper/2505.04642"},"observation_digest":"sha256:4bba46df61a402ac70a83bb658831ecc132ea71f2f023747c620a224cb7ad562","observation_id":"52620d57-feb8-42bc-bf10-e7cfb4f32f1a","resolution":{"observed_at":"2026-08-16T00:59:33.201907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:33.181839Z","title":"Modality -to-modality translation: Adversarial representation learning and graph fusion network,","venue":null,"work_id":"8f5efac2-4c64-468f-a61f-3f079606e087","year":2020},"citing_paper":{"arxiv_id":"2505.04642","last_updated":"2025-05-05T02:31:11Z","snapshot_observed_at":"2026-08-20T03:34:59.212344Z","submitted_at":"2025-05-05T02:31:11Z","title":"Rethinking Multimodal Sentiment Analysis: A High-Accuracy, Simplified Fusion Architecture","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:32.984630Z"},"links":{"citing_paper":"/paper/2505.04642"},"observation_digest":"sha256:5580199b43ee915dc72415c1ee864ef194c0bd93d305ab8cf4626e3750cff605","observation_id":"1df16a2c-6d14-42e1-99d9-327b2b3eb194","resolution":{"observed_at":"2026-08-16T00:59:33.187257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:33.166089Z","title":"M -SENA: An integrated platform for multimodal sentiment analysis,","venue":null,"work_id":"6e62524b-b37e-422b-9325-5f8032e48f90","year":2022},"citing_paper":{"arxiv_id":"2505.04642","last_updated":"2025-05-05T02:31:11Z","snapshot_observed_at":"2026-08-20T03:34:59.212344Z","submitted_at":"2025-05-05T02:31:11Z","title":"Rethinking Multimodal Sentiment Analysis: A High-Accuracy, Simplified Fusion Architecture","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:32.989104Z"},"links":{"citing_paper":"/paper/2505.04642"},"observation_digest":"sha256:959aa1dd7983fb35761a961af9a2a8fcaccad25b781cf4a6d6100d7e4857791f","observation_id":"49dddc06-5c96-40b7-9da8-e2013a3df955","resolution":{"observed_at":"2026-08-16T00:59:33.171000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06259","last_updated":"2016-08-12T02:39:40Z","snapshot_observed_at":"2026-08-19T17:12:22.274477Z","submitted_at":"2016-06-20T19:23:53Z","title":"MOSI: Multimodal Corpus of Sentiment Intensity and Subjectivity Analysis in Online Opinion Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06259","snapshot_observed_at":"2026-08-16T00:59:32.993558Z","title":"MOSI: Multimodal corpus of sentiment intensity and subjectivity analysis in online opinion videos,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.04642","last_updated":"2025-05-05T02:31:11Z","snapshot_observed_at":"2026-08-20T03:34:59.212344Z","submitted_at":"2025-05-05T02:31:11Z","title":"Rethinking Multimodal Sentiment Analysis: A High-Accuracy, Simplified Fusion Architecture","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:32.993558Z"},"links":{"cited_paper":"/paper/1606.06259","citing_paper":"/paper/2505.04642"},"observation_digest":"sha256:ed08b96a4700ef6eddb22f586553e3df4945eda2e7e8e1ec753c18b0f66a3406","observation_id":"b623f86d-b6aa-4860-b1e8-9821e53e1fae","resolution":{"observed_at":"2026-08-16T00:59:32.993558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:33.151134Z","title":"DialogueTRM: Exploring multimodal emotional dynamics in conversation,","venue":null,"work_id":"d4d1855c-03b8-49d2-9f3d-f192bfafc0fc","year":2021},"citing_paper":{"arxiv_id":"2505.04642","last_updated":"2025-05-05T02:31:11Z","snapshot_observed_at":"2026-08-20T03:34:59.212344Z","submitted_at":"2025-05-05T02:31:11Z","title":"Rethinking Multimodal Sentiment Analysis: A High-Accuracy, Simplified Fusion Architecture","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:32.998118Z"},"links":{"citing_paper":"/paper/2505.04642"},"observation_digest":"sha256:98bc80ca0e8d777a4d55aeb0567766b3104b869f85cc3017b7f764fd51cff152","observation_id":"6362f5ae-11da-48b3-90a3-23d10b64967b","resolution":{"observed_at":"2026-08-16T00:59:33.156374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:33.136440Z","title":"LXMERT: Learning cross -modality encoder representations,","venue":null,"work_id":"aedc2e2d-eadf-4f34-a18c-49a709390612","year":2019},"citing_paper":{"arxiv_id":"2505.04642","last_updated":"2025-05-05T02:31:11Z","snapshot_observed_at":"2026-08-20T03:34:59.212344Z","submitted_at":"2025-05-05T02:31:11Z","title":"Rethinking Multimodal Sentiment Analysis: A High-Accuracy, Simplified Fusion Architecture","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:33.002893Z"},"links":{"citing_paper":"/paper/2505.04642"},"observation_digest":"sha256:35681957d7fe047f14ae4e14d278f61b7ad80bf0dedbcbebc128562a1cc5424c","observation_id":"9c0b7bd6-bcac-440c-b029-37b032420dcd","resolution":{"observed_at":"2026-08-16T00:59:33.141468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:33.253786Z","title":"On the efficiency of multimodal architectures: A case study in sentiment analysis,","venue":null,"work_id":"2df11237-fc39-49c1-925e-3319967b1c03","year":2020},"citing_paper":{"arxiv_id":"2505.04642","last_updated":"2025-05-05T02:31:11Z","snapshot_observed_at":"2026-08-20T03:34:59.212344Z","submitted_at":"2025-05-05T02:31:11Z","title":"Rethinking Multimodal Sentiment Analysis: A High-Accuracy, Simplified Fusion Architecture","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:33.007384Z"},"links":{"citing_paper":"/paper/2505.04642"},"observation_digest":"sha256:ca960c3a57398ffbb70c409e978e40f9f88a391d9ab31c31225b904e65fac7f0","observation_id":"e98c8923-0dce-463b-8fac-13e242874ca0","resolution":{"observed_at":"2026-08-16T00:59:33.258312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.01368","last_updated":"2021-12-02T16:09:33Z","snapshot_observed_at":"2026-08-17T15:38:57.713273Z","submitted_at":"2021-12-02T16:09:33Z","title":"ScaleVLAD: Improving Multimodal Sentiment Analysis via Multi-Scale Fusion of Locally Descriptors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.01368","snapshot_observed_at":"2026-08-16T00:59:33.011697Z","title":"ScaleVLAD: Improving multimodal sentiment analysis via multi-scale fusion of local descriptors,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.04642","last_updated":"2025-05-05T02:31:11Z","snapshot_observed_at":"2026-08-20T03:34:59.212344Z","submitted_at":"2025-05-05T02:31:11Z","title":"Rethinking Multimodal Sentiment Analysis: A High-Accuracy, Simplified Fusion Architecture","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:33.011697Z"},"links":{"cited_paper":"/paper/2112.01368","citing_paper":"/paper/2505.04642"},"observation_digest":"sha256:7294276efea59eaab20aa2df1fe9e3fe29d883d246c8801fdf85f2261c6077aa","observation_id":"f01913a8-7472-4c92-8f98-27365c47f5ad","resolution":{"observed_at":"2026-08-16T00:59:33.011697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18162","last_updated":"2024-11-27T09:18:26Z","snapshot_observed_at":"2026-08-18T11:19:22.365461Z","submitted_at":"2024-11-27T09:18:26Z","title":"SentiXRL: An advanced large language Model Framework for Multilingual Fine-Grained Emotion Classification in Complex Text Environment","version":1},"cited_work":{"arxiv_id":"2411.18162","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.18162","snapshot_observed_at":"2026-08-16T00:59:33.059344Z","title":"SentiXRL: An advanced large language Model Framework for Multilingual Fine-Grained Emotion Classification in Complex Text Environment","venue":"cs.CL","work_id":"0400f2ed-2c29-411b-a225-1d7954b3c7ed","year":2024},"citing_paper":{"arxiv_id":"2505.04642","last_updated":"2025-05-05T02:31:11Z","snapshot_observed_at":"2026-08-20T03:34:59.212344Z","submitted_at":"2025-05-05T02:31:11Z","title":"Rethinking Multimodal Sentiment Analysis: A High-Accuracy, Simplified Fusion Architecture","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:33.016436Z"},"links":{"cited_paper":"/paper/2411.18162","citing_paper":"/paper/2505.04642"},"observation_digest":"sha256:435140b153fd705de59e6d2aa79c632cee3cde05cc9b13b678e5a3d35acd743f","observation_id":"94c4de2c-b104-45ba-8099-45bc526fcf39","resolution":{"observed_at":"2026-08-16T00:59:33.066519Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:33.121090Z","title":"Tensor Fusion Network for multimodal sentiment analysis,","venue":null,"work_id":"507c998d-4066-4de7-bfb1-9df7ba8805c3","year":2017},"citing_paper":{"arxiv_id":"2505.04642","last_updated":"2025-05-05T02:31:11Z","snapshot_observed_at":"2026-08-20T03:34:59.212344Z","submitted_at":"2025-05-05T02:31:11Z","title":"Rethinking Multimodal Sentiment Analysis: A High-Accuracy, Simplified Fusion Architecture","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:33.021091Z"},"links":{"citing_paper":"/paper/2505.04642"},"observation_digest":"sha256:350280d67bdb565457f3819c3e060e827f86ff173b9c130696938ca72a260b34","observation_id":"187de330-df0d-4c26-8189-11676d2cd9e4","resolution":{"observed_at":"2026-08-16T00:59:33.126281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:33.106787Z","title":"Multimodal deep learning,","venue":null,"work_id":"e2080c34-b442-4544-a672-cf746e47a747","year":2011},"citing_paper":{"arxiv_id":"2505.04642","last_updated":"2025-05-05T02:31:11Z","snapshot_observed_at":"2026-08-20T03:34:59.212344Z","submitted_at":"2025-05-05T02:31:11Z","title":"Rethinking Multimodal Sentiment Analysis: A High-Accuracy, Simplified Fusion Architecture","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:33.025292Z"},"links":{"citing_paper":"/paper/2505.04642"},"observation_digest":"sha256:30069a6ff92506608d69681fc9bc67a182882cd3881cc8c162599f39866f1474","observation_id":"4c06f9c7-8361-42e1-a57e-857dd466b661","resolution":{"observed_at":"2026-08-16T00:59:33.111420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.04642","last_updated":"2025-05-05T02:31:11Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-20T03:34:59.212344Z","submitted_at":"2025-05-05T02:31:11Z","title":"Rethinking Multimodal Sentiment Analysis: A High-Accuracy, Simplified Fusion Architecture"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":1,"verified_fuzzy":22},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2505.04642."}