{"as_of":"2026-08-13T06:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:acac9542046d0611353668db870e62155bca66ed5928c1c601748fd3aeb49a8e","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T18:21:40.130112Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T08:26:49.097526Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-11T18:14:10.933935Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08049","snapshot_observed_at":"2026-08-04T08:26:49.097526Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.20743","last_updated":"2026-05-28T07:50:13Z","snapshot_observed_at":"2026-08-06T19:00:45.467472Z","submitted_at":"2025-10-23T17:08:03Z","title":"Empathic Prompting: Non-Verbal Context Integration for Multimodal LLM Conversations","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T08:26:49.097526Z"},"links":{"cited_paper":"/paper/2412.08049","citing_paper":"/paper/2510.20743"},"observation_digest":"sha256:89bc67d7b3cce0c731d31448e6bc58c2758f65816e7c0b3e217d9621d2d1db74","observation_id":"0770b773-f9f8-486f-8a63-2e77ea8dca96","resolution":{"observed_at":"2026-08-04T08:26:49.097526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.08049/citation-record","integrity":"/paper/2412.08049/integrity","json":"/paper/2412.08049/citation-record.json","paper":"/paper/2412.08049"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-11T18:21:39.877031Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-11T18:14:10.933935Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:39.877031Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:34ac6117e9c4d6374d3117b7bf6076acc2a89421687756b16725637652fb764d","observation_id":"38cfe572-9de1-4a26-bfed-f833afb4993a","resolution":{"observed_at":"2026-08-11T18:21:39.877031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:21:40.851948Z","title":"Semi-supervised mul- timodal emotion recognition with expression mae","venue":null,"work_id":"13a7acd7-36fe-4e0d-94b6-1df7648507b2","year":2023},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-11T18:14:10.933935Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:39.894745Z"},"links":{"citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:61e0bf3a40285858fa0d1c76be906beed949cb01b1ecc4ba1addad9da24a4ccb","observation_id":"ad6fd5f2-348b-483b-a391-bf0c003a45e0","resolution":{"observed_at":"2026-08-11T18:21:40.856845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11161","last_updated":"2024-11-02T02:30:50Z","snapshot_observed_at":"2026-08-12T23:41:31.100924Z","submitted_at":"2024-06-17T03:01:22Z","title":"Emotion-LLaMA: Multimodal Emotion Recognition and Reasoning with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11161","snapshot_observed_at":"2026-08-11T18:21:39.900836Z","title":"Emotion-llama: Multimodal emotion recognition and reasoning with instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-11T18:14:10.933935Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:39.900836Z"},"links":{"cited_paper":"/paper/2406.11161","citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:ad2e176d5a7d199894672de20ddd8385a3b01ceb19bdcc5dabc665d19855c4b7","observation_id":"1cbf995a-8d64-4d85-a7eb-727bc0427149","resolution":{"observed_at":"2026-08-11T18:21:39.900836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-11T18:21:39.906511Z","title":"Videollama 2: Advancing spatial-temporal model- ing and audio understanding in video-llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-11T18:14:10.933935Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:39.906511Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:29fd6c78c89afa7d705e85efe6a057f08b6a2206038adf5513306b56d9e12f71","observation_id":"c7af2a0a-c42c-466e-b75d-ef422d42529a","resolution":{"observed_at":"2026-08-11T18:21:39.906511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:21:40.835509Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale,","venue":null,"work_id":"76c08b84-2bde-4c99-8161-83841208d438","year":2021},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-11T18:14:10.933935Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:39.913103Z"},"links":{"citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:442519dba37a3bc26f0719f09e5bb608521d5bc01efa53eefd0e16882a83c100","observation_id":"0b78fe39-4f5a-42d6-9d35-83871aea5406","resolution":{"observed_at":"2026-08-11T18:21:40.841153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00412","last_updated":"2021-09-16T08:32:03Z","snapshot_observed_at":"2026-08-09T19:44:37.485389Z","submitted_at":"2021-09-01T14:45:16Z","title":"Improving Multimodal Fusion with Hierarchical Mutual Information Maximization for Multimodal Sentiment Analysis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00412","snapshot_observed_at":"2026-08-11T18:21:39.935774Z","title":"Improving multimodal fusion with hierarchical mutual in- formation maximization for multimodal sentiment analy- sis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-11T18:14:10.933935Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:39.935774Z"},"links":{"cited_paper":"/paper/2109.00412","citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:93b89dc6ace3f6df45b62bc27e98e3a572d6e99352f9b4c8330f04fcbc15ac35","observation_id":"13600439-a05d-4b2f-987f-c6fea71f90f6","resolution":{"observed_at":"2026-08-11T18:21:39.935774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:21:39.944300Z","title":"Misa: Modality-invariant and-specific representations for multimodal sentiment analysis","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-11T18:14:10.933935Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:39.944300Z"},"links":{"citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:a34dfa4eda7ea3b87953a5c54548f4c0e6e43423e52fe0cece1c935336a4f3ec","observation_id":"63ce4830-d61d-405d-a5b2-2e7622a1c93e","resolution":{"observed_at":"2026-08-11T18:21:39.944300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.01978","last_updated":"2021-06-09T05:28:04Z","snapshot_observed_at":"2026-07-06T11:15:43.397820Z","submitted_at":"2021-06-03T16:47:38Z","title":"DialogueCRN: Contextual Reasoning Networks for Emotion Recognition in Conversations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.01978","snapshot_observed_at":"2026-08-11T18:21:39.960892Z","title":"Dialoguecrn: Contextual reasoning networks for emotion recognition in conversations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-11T18:14:10.933935Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:39.960892Z"},"links":{"cited_paper":"/paper/2106.01978","citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:8988a0ac851e3cc56771321c317ae417d6736a41e7803197b9ed1a4cddf6b17a","observation_id":"4646f9c1-2410-4214-be60-911b2b7631d2","resolution":{"observed_at":"2026-08-11T18:21:39.960892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-11T18:21:39.970411Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-11T18:14:10.933935Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:39.970411Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:6c98766646755300cc74305e8aef563927cd01718fb2ad28de95920a6ed434d9","observation_id":"c8f09bc7-6a46-461f-99c7-de298d0f8202","resolution":{"observed_at":"2026-08-11T18:21:39.970411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06779","last_updated":"2021-07-14T15:37:02Z","snapshot_observed_at":"2026-07-06T11:29:07.489964Z","submitted_at":"2021-07-14T15:37:02Z","title":"MMGCN: Multimodal Fusion via Deep Graph Convolution Network for Emotion Recognition in Conversation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06779","snapshot_observed_at":"2026-08-11T18:21:39.977064Z","title":"Mmgcn: Multimodal fusion via deep graph convolution network for emotion recognition in conversa- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-11T18:14:10.933935Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:39.977064Z"},"links":{"cited_paper":"/paper/2107.06779","citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:ac5a6d0f005b0b511fb19ad2dcb8477035f3e9555f4ae36f5671f6ce4e55c02e","observation_id":"6ee4b11e-4ac7-4cae-a8ca-2714cf3d90d0","resolution":{"observed_at":"2026-08-11T18:21:39.977064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:21:40.778219Z","title":"Mm-dfn: Multimodal dy- namic fusion network for emotion recognition in con- versations","venue":null,"work_id":"d82b8390-0dcf-41e3-9b47-59bbbd15df0d","year":2022},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-11T18:14:10.933935Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:39.990244Z"},"links":{"citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:18f5afc89353a9c3b9bb65545b4ccc6a551d18bd613f5a08195d230c61cacd77","observation_id":"8548ba0b-19cd-4b6f-9926-edaa57f94683","resolution":{"observed_at":"2026-08-11T18:21:40.783500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:21:40.761915Z","title":"Dfew: A large-scale database for recognizing dynamic facial expressions in the wild","venue":null,"work_id":"0bfff4d0-99de-41d4-95fb-594146765138","year":2020},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-11T18:14:10.933935Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:40.001853Z"},"links":{"citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:734996c7bdacd32c02cc319cb5a64262a19b8a094cba4e37163caffc5167e4f4","observation_id":"46fe8cbc-802e-4a71-aee9-49035aa7d748","resolution":{"observed_at":"2026-08-11T18:21:40.766604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11911","last_updated":"2024-08-29T05:14:36Z","snapshot_observed_at":"2026-08-09T05:40:16.745549Z","submitted_at":"2023-09-21T09:22:07Z","title":"InstructERC: Reforming Emotion Recognition in Conversation with Multi-task Retrieval-Augmented Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11911","snapshot_observed_at":"2026-08-11T18:21:40.008378Z","title":"Instructerc: Reforming emotion recognition in conversation with a retrieval multi-task llms framework","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-11T18:14:10.933935Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:40.008378Z"},"links":{"cited_paper":"/paper/2309.11911","citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:4500b835e3af3604a811a5a2e771474e3807b5e8437b3ecdc234edbc2a9e8285","observation_id":"84d3364f-fb6b-4ade-b9be-fc82fdf8daf4","resolution":{"observed_at":"2026-08-11T18:21:40.008378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13504","last_updated":"2022-03-25T08:42:57Z","snapshot_observed_at":"2026-07-06T12:52:16.992962Z","submitted_at":"2022-03-25T08:42:57Z","title":"EmoCaps: Emotion Capsule based Model for Conversational Emotion Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.13504","snapshot_observed_at":"2026-08-11T18:21:40.017251Z","title":"Emocaps: Emotion capsule based model for conversational emotion recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-11T18:14:10.933935Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:40.017251Z"},"links":{"cited_paper":"/paper/2203.13504","citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:0e20dc35cfc58182c0e7b71d53f010f2fa77d44c9e6f4e685af971deb3a4b7a4","observation_id":"f29ba094-f9f0-41b5-bada-ecdee5db2065","resolution":{"observed_at":"2026-08-11T18:21:40.017251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:21:40.744826Z","title":"Explainable mul- timodal emotion recognition,","venue":null,"work_id":"c07b6c96-c85c-4f40-b0c4-4a246d5c92e6","year":2024},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-11T18:14:10.933935Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:40.031448Z"},"links":{"citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:0540a212c85a2006abd4f973ff39b6338a6913d251a950f5d6603de20aa89300","observation_id":"fd9823b1-df60-478f-bbc9-7b7aa1a56cfd","resolution":{"observed_at":"2026-08-11T18:21:40.751483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:21:40.036712Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-11T18:14:10.933935Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:40.036712Z"},"links":{"citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:c91cb8b1d10e76e20b98e71863f38fec31e2a0f764e12d8b495df7e421c0bc90","observation_id":"aab7339c-115e-4cb4-a2f8-80ec527ca8e0","resolution":{"observed_at":"2026-08-11T18:21:40.036712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:21:40.047875Z","title":"Progressive modality re- inforcement for human multimodal emotion recognition from unaligned multimodal sequences","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-11T18:14:10.933935Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:40.047875Z"},"links":{"citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:6f3a15d319028b0d122ef37e008cac7ad7bf462598ffed2ab9f963af9865c68c","observation_id":"e7c415b4-e5f2-4904-89b9-2e90276cd614","resolution":{"observed_at":"2026-08-11T18:21:40.047875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.02508","last_updated":"2019-06-04T12:33:49Z","snapshot_observed_at":"2026-08-09T15:41:11.041317Z","submitted_at":"2018-10-05T03:50:24Z","title":"MELD: A Multimodal Multi-Party Dataset for Emotion Recognition in Conversations","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.02508","snapshot_observed_at":"2026-08-11T18:21:40.053544Z","title":"Meld: A multimodal multi-party dataset for emotion recognition in conversations","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-11T18:14:10.933935Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:40.053544Z"},"links":{"cited_paper":"/paper/1810.02508","citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:e2dcf265bc940d478ee31e474961bc4023d06290f355d3f4e015431228c84395","observation_id":"1444384f-54c8-484c-b745-b60e68337c55","resolution":{"observed_at":"2026-08-11T18:21:40.053544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:21:40.709726Z","title":"A discourse-aware graph neural network for emotion recog- nition in multi-party conversation","venue":null,"work_id":"12d764a6-34f4-49c7-8a07-f6ebb4e40ffd","year":2021},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-11T18:14:10.933935Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:40.067954Z"},"links":{"citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:ed7162b0321dd2957908d4fae16ea2d8dba70ffd608721727a56445b5252d275","observation_id":"72734523-fcd9-4099-a78d-cbd198eff2d7","resolution":{"observed_at":"2026-08-11T18:21:40.715435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:21:40.074867Z","title":"Multimodal transformer for un- aligned multimodal language sequences","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-11T18:14:10.933935Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:40.074867Z"},"links":{"citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:67ab702f8890f9bce554ba90629c3e043617590d81f0c04cc535447b82a9d59b","observation_id":"f3f173ee-91d7-47db-a27f-83203db5072d","resolution":{"observed_at":"2026-08-11T18:21:40.074867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:21:40.668300Z","title":"SemEval-2024 task 3: Multimodal emotion cause analysis in conversations","venue":null,"work_id":"64932656-fac5-481e-82f7-eddbb3b6e1da","year":2024},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-11T18:14:10.933935Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:40.084097Z"},"links":{"citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:e0820ae1795a716b3a05e2f6f91f055430d35e13f7545a840f9a487306e1f074","observation_id":"5f4cf55e-d52b-48d9-ac13-d5517cca97e5","resolution":{"observed_at":"2026-08-11T18:21:40.675015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:21:40.651866Z","title":"Confede: Contrastive feature de- composition for multimodal sentiment analysis","venue":null,"work_id":"f75be6f7-aaa5-4d7f-a4a5-64a9b7a8c666","year":2023},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-11T18:14:10.933935Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:40.091473Z"},"links":{"citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:1cf08f7b561be97e35f0e08ed9a6fe3f6ed665a1ef1df9d23f9e54cd7ae3caf1","observation_id":"bdb5e7d8-6c67-443f-8fbc-bfb831e57274","resolution":{"observed_at":"2026-08-11T18:21:40.657080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:21:40.633996Z","title":"Learning modality-specific representations with self- supervised multi-task learning for multimodal sentiment analysis","venue":null,"work_id":"89b575d2-7129-4bba-8a04-16ab000bbf1d","year":2021},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-11T18:14:10.933935Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:40.097739Z"},"links":{"citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:e9fa6abea4e7a09474a7d1823d399861e4ea8b0276f9abbb5e730b1fb8212123","observation_id":"7fb9be27-7497-445a-948e-a62133d6c9e9","resolution":{"observed_at":"2026-08-11T18:21:40.640279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15796","last_updated":"2023-06-27T20:51:03Z","snapshot_observed_at":"2026-07-06T15:47:30.367367Z","submitted_at":"2023-06-27T20:51:03Z","title":"ConKI: Contrastive Knowledge Injection for Multimodal Sentiment Analysis","version":1},"cited_work":{"arxiv_id":"2306.15796","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.15796","snapshot_observed_at":"2026-08-11T18:21:40.203198Z","title":"ConKI: Contrastive Knowledge Injection for Multimodal Sentiment Analysis","venue":"cs.AI","work_id":"795f0dd2-6f31-497f-a295-b46b687ccc16","year":2023},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-11T18:14:10.933935Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:40.104909Z"},"links":{"cited_paper":"/paper/2306.15796","citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:0c14e7361ec11aa8646cd064a1967e26c208548b5de8d70677fa0d10fc48cdce","observation_id":"22fa6b69-d2a6-4559-97c4-8d1b672a22b7","resolution":{"observed_at":"2026-08-11T18:21:40.213308Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:21:40.111189Z","title":"Multimodal language analysis in the wild: Cmu- mosei dataset and interpretable dynamic fusion graph","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-11T18:14:10.933935Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:40.111189Z"},"links":{"citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:5398bf74d053203049e19eac940b9c9a76badd79ef72476f6848cbf5c321937a","observation_id":"4d621abb-ab80-451c-8467-9752863ab3af","resolution":{"observed_at":"2026-08-11T18:21:40.111189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:21:40.595490Z","title":"A multitask learning model for multimodal sarcasm, sentiment and emotion recognition in conversa- tions","venue":null,"work_id":"8970aa14-211e-49d2-94ed-51f1fd3334bd","year":2023},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-11T18:14:10.933935Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:40.116921Z"},"links":{"citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:b5f1697cd3f53525c1dfd1438a6481cd521d246de0b7f763c6cd6b14d30bcd63","observation_id":"3309d835-496c-4d93-905d-9ae35c6d2b95","resolution":{"observed_at":"2026-08-11T18:21:40.601901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-11T18:21:40.124826Z","title":"Video instruction tuning with synthetic data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-11T18:14:10.933935Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:40.124826Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:a725b136c4a3da9b98b3c31fb26310031e4934d93f983891e3220224d575563f","observation_id":"31a005c2-9ab3-41f9-9704-da2a26c1485a","resolution":{"observed_at":"2026-08-11T18:21:40.124826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:21:40.569578Z","title":"A facial expression-aware multimodal multi- task learning framework for emotion recognition in multi- party conversations","venue":null,"work_id":"3e8433ec-c30e-414d-ba4f-1af349449215","year":2023},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-11T18:14:10.933935Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:40.130112Z"},"links":{"citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:094d39efb9de61dc3515abb3ff03033a34aeef7dd97fe5e9f8f4a4747f8d50e7","observation_id":"f9f1515f-ce4e-4ca9-9a9e-d649395dfb71","resolution":{"observed_at":"2026-08-11T18:21:40.577739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.12907","last_updated":"2021-09-16T02:22:09Z","snapshot_observed_at":"2026-07-06T11:13:10.201132Z","submitted_at":"2021-05-27T01:51:37Z","title":"Directed Acyclic Graph Network for Conversational Emotion Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.12907","snapshot_observed_at":"2026-08-11T18:21:40.061006Z","title":"Directed acyclic graph network for conversational emotion recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-11T18:14:10.933935Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:40.061006Z"},"links":{"cited_paper":"/paper/2105.12907","citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:cb02a0fb99daaa8e8987c85de664e388bfe7d6ad18102b9abc19fee706660ca6","observation_id":"4df90b3c-8f35-4f47-b85a-3bbdafb567b0","resolution":{"observed_at":"2026-08-11T18:21:40.061006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:21:40.817748Z","title":"Bi-bimodal modality fusion for correlation-controlled multimodal sentiment analysis","venue":null,"work_id":"51b25ff8-6a50-483e-9a1a-8af54d2b5826","year":2021},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-11T18:14:10.933935Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:39.929705Z"},"links":{"citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:baf65f636915b1b99ec5179d8d009cfea3a71e57d175cd2df5e793695ca54ceb","observation_id":"be1debd5-d809-40d3-ae3a-f8ebf9f8cfb2","resolution":{"observed_at":"2026-08-11T18:21:40.824020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:21:40.793023Z","title":"Hubert: Self- supervised speech representation learning by masked pre- diction of hidden units","venue":null,"work_id":"cfd68c57-c71e-4bbe-af74-9cae592bb130","year":2021},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-11T18:14:10.933935Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:39.951671Z"},"links":{"citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:8681fb712e6fa96adddf8fcf2bf0fac79da79b6bd93af421cf7a6f0f3442791e","observation_id":"91e507e8-8cc7-41c2-92a5-72d86bb8a72d","resolution":{"observed_at":"2026-08-11T18:21:40.797771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.11540","last_updated":"2019-08-30T05:44:24Z","snapshot_observed_at":"2026-08-10T02:18:19.197213Z","submitted_at":"2019-08-30T05:44:24Z","title":"DialogueGCN: A Graph Convolutional Neural Network for Emotion Recognition in Conversation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.11540","snapshot_observed_at":"2026-08-11T18:21:39.924087Z","title":"Dialoguegcn: A graph convolutional neural network for emotion recognition in conversation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-11T18:14:10.933935Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:39.924087Z"},"links":{"cited_paper":"/paper/1908.11540","citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:0b53759dfb1715e82f736a500098092558d88b7df7d2ec8fa514eb9374f71a77","observation_id":"37ab2d83-624c-47cc-9c87-69ac303faf45","resolution":{"observed_at":"2026-08-11T18:21:39.924087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11256","last_updated":"2022-11-21T08:46:01Z","snapshot_observed_at":"2026-08-10T23:23:48.223778Z","submitted_at":"2022-11-21T08:46:01Z","title":"UniMSE: Towards Unified Multimodal Sentiment Analysis and Emotion Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11256","snapshot_observed_at":"2026-08-11T18:21:39.994601Z","title":"Unimse: Towards unified multimodal sentiment analysis and emo- tion recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-11T18:14:10.933935Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:39.994601Z"},"links":{"cited_paper":"/paper/2211.11256","citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:62ed2c6b296d0f14a66c534c751e5d3c0cc238c2933eadaa8f23fa709cbbf0d6","observation_id":"30395d18-969e-4706-942a-949d16027849","resolution":{"observed_at":"2026-08-11T18:21:39.994601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-11T18:21:39.888754Z","title":"How far are we to gpt-4v? closing the gap to commercial mul- timodal models with open-source suites","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-11T18:14:10.933935Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:39.888754Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:554ce7b129bd609bce1ce989c46ec06387f714cf150d5f3ed4ec97111487de84","observation_id":"ea631df8-e4ad-4d4f-89bd-cdf051da4453","resolution":{"observed_at":"2026-08-11T18:21:39.888754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-11T18:21:39.882645Z","title":"Minigpt-v2: large language model as a unified interface for vision-language multi-task learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-11T18:14:10.933935Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:39.882645Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:57fc0002385817e07406c0b4700a0aff36cc3a96cfa0ba8bc0a1d4b6815253bf","observation_id":"39ffd1b8-6266-4116-a151-0f461cff5335","resolution":{"observed_at":"2026-08-11T18:21:39.882645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-11T18:14:10.933935Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":1,"verified_fuzzy":13},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 1 inbound Pith citation observation for arXiv:2412.08049."}