{"as_of":"2026-08-07T17:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7a71c7c48869b3ba1cee50aeb03655c3cedce7a7a691ceccda7f4c2d338c598c","coverage":[{"denominator":74,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":74,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T05:02:24.778729Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T11:19:34.140857Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T13:55:53.243562Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02429","snapshot_observed_at":"2026-08-03T11:19:34.140857Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.06870","last_updated":"2026-05-24T17:00:03Z","snapshot_observed_at":"2026-08-03T11:19:26.518218Z","submitted_at":"2026-01-11T11:29:21Z","title":"QASA: Quality-Aware Semantic Augmentation for Robust Multimodal Sentiment Analysis","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-03T11:19:34.140857Z"},"links":{"cited_paper":"/paper/2508.02429","citing_paper":"/paper/2601.06870"},"observation_digest":"sha256:fb5f8c97a866f5af1687ce96ac6b383017b845c2402fb0e07de7b1789bca9f4a","observation_id":"8b65755c-ea84-4a75-8437-4557e50e4303","resolution":{"observed_at":"2026-08-03T11:19:34.140857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"cited_work":{"arxiv_id":"2508.02429","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.02429","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal large language models for end-to-end affective computing: Benchmarking and boosting with generative knowledge prompting","venue":null,"work_id":"a4695b16-2cd7-43bf-b923-39956af2848c","year":2025},"citing_paper":{"arxiv_id":"2604.00013","last_updated":"2026-04-12T03:30:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-10T12:48:41Z","title":"C2F-Thinker: Coarse-to-Fine Reasoning with Hint-Guided Reinforcement Learning for Multimodal Sentiment Analysis","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T13:51:40.334057Z"},"links":{"cited_paper":"/paper/2508.02429","citing_paper":"/paper/2604.00013"},"observation_digest":"sha256:5f11018a7ceaad154de22476e2680bc68b6abdf4f47eec62ee165e1272394e44","observation_id":"73165972-423e-47ac-9fdc-f2fb77c25237","resolution":{"observed_at":"2026-05-15T13:55:53.245819Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.02429/citation-record","integrity":"/paper/2508.02429/integrity","json":"/paper/2508.02429/citation-record.json","paper":"/paper/2508.02429"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:24.340081Z","title":"A review of affective computing: From unimodal analysis to multimodal fusion,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.340081Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:76656fc6056807b68a36346633ed17487d1e59ecc8495698d037e76dc5d8fabf","observation_id":"97ea4dbf-5925-42e3-87e0-8cbc9aab1064","resolution":{"observed_at":"2026-08-06T05:02:24.340081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:31.405170Z","title":"A systematic review on affective computing: Emotion models, databases, and recent advances,","venue":null,"work_id":"d6f11035-1b9d-46f1-96dd-2d6dc22781f8","year":2022},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.345319Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:d1e7e9ef7a8b06aea1f255a26e18135c5891b52edec768ed1a2a8f6db3bf8355","observation_id":"11db27f3-e04a-4364-a9a2-a32fe4fb8e4a","resolution":{"observed_at":"2026-08-06T05:02:31.520898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:31.174721Z","title":"An effective data fusion methodology for multi-modal emotion recognition: A survey,","venue":null,"work_id":"a40c2b72-405b-4578-a9ff-314965953f2f","year":2024},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.350453Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:e360c62a1938aa0b7fe0132692687b82fe411ed57a9504c91642e7c4f8c0f935","observation_id":"de78fbb7-3a1d-4f76-84a8-a9aca737d6bd","resolution":{"observed_at":"2026-08-06T05:02:31.232058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:24.355118Z","title":"Surveying the mllm landscape: A meta-review of current surveys,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.355118Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:39845c733f4beedb38be66764eaddd0449e43bb35747dcb37708eb1f68e3d151","observation_id":"b7525118-6794-41e5-a078-930cd45e178b","resolution":{"observed_at":"2026-08-06T05:02:24.355118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:31.002154Z","title":"Learning by comparing: Boosting multi- modal affective computing through ordinal learning,","venue":null,"work_id":"5cac80ff-f5b4-4c95-a98f-ca75f7a0e477","year":2025},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.359998Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:f50af94ded63aac27714f5acdfdb6f29eb5012395b9acc4a1c59b287d690ee3a","observation_id":"f1b077f7-53f5-49e0-b917-d81568e64559","resolution":{"observed_at":"2026-08-06T05:02:31.087023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:30.814165Z","title":"Llm-based nlg evaluation: Current status and challenges,","venue":null,"work_id":"b6c61c05-28cc-4029-9ac2-4beecf48bcfd","year":2025},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.365403Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:38dc82093a2858f7fe0063d429d24ecd24c1714a0517f316d5348878447b30f6","observation_id":"e75fac92-5937-4d9f-99cf-2ab6992642da","resolution":{"observed_at":"2026-08-06T05:02:30.871599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17421","snapshot_observed_at":"2026-08-06T05:02:24.371526Z","title":"The dawn of lmms: Preliminary explorations with gpt-4v (ision),","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.371526Z"},"links":{"cited_paper":"/paper/2309.17421","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:bc00fdce5ff1a94cc927438519ed50c9bee284a2ca8735abd0f4d6dd0c9a10bd","observation_id":"f3f1bbd2-9bca-4223-b3f0-c63677aba923","resolution":{"observed_at":"2026-08-06T05:02:24.371526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:30.637214Z","title":"Visual instruction tuning,","venue":null,"work_id":"d7256e8e-1135-41dc-b31b-a91a32487d6d","year":2023},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.378442Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:e75c63f45511c8cd03f846f1793f32a064982fbc5f464501d1e6939b6b1f461c","observation_id":"81d76dc5-c191-4d76-9687-2d6e99d50007","resolution":{"observed_at":"2026-08-06T05:02:30.718937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T05:02:24.382903Z","title":"Gemini: a family of highly capable multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.382903Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:bc2b451ff95423334d414c4116df60b29f1d2b5126b02905663059fb881a2a72","observation_id":"0fe48994-3171-4398-b5a2-43388ce28bca","resolution":{"observed_at":"2026-08-06T05:02:24.382903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:30.451460Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization,","venue":null,"work_id":"0f805edb-6183-48b6-86d9-eb1cf6126486","year":2023},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.388809Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:781813c0b7173e0ba806bd377327d59eaadbc11fa25c0639beb7a9965b5907c8","observation_id":"bd611aaf-b1b6-4e25-96de-8140eb598eae","resolution":{"observed_at":"2026-08-06T05:02:30.529258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:30.335588Z","title":"A survey on multimodal large language models,","venue":null,"work_id":"b394c4f6-c78c-4d80-9276-82720307d569","year":2024},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.394458Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:919562d01c7c26e9722dd0f835eaaeeea2de8fc1baae5b9530ad4664e799c943","observation_id":"df5a41c4-2648-4435-a407-e74517b4513f","resolution":{"observed_at":"2026-08-06T05:02:30.385999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13359","last_updated":"2024-09-20T09:44:51Z","snapshot_observed_at":"2026-07-06T19:18:41.002837Z","submitted_at":"2024-09-20T09:44:51Z","title":"EmotionQueen: A Benchmark for Evaluating Empathy of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13359","snapshot_observed_at":"2026-08-06T05:02:24.399808Z","title":"Emotionqueen: A benchmark for evaluating empathy of large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.399808Z"},"links":{"cited_paper":"/paper/2409.13359","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:3347f2a9f6ee28ea4ed61a0ff1f9eed816b45f1b2d5d92aee29b038132f1aa31","observation_id":"b0d994dc-4d41-410e-91a1-54be9d9d8e9a","resolution":{"observed_at":"2026-08-06T05:02:24.399808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:24.405487Z","title":"Eemo-bench: A benchmark for multi-modal large lan- guage models on image evoked emotion assessment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.405487Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:ec88768739570bde4b0f8f6eb70f6cbc8a95d68ce66766dcb3306c67d792fb46","observation_id":"54470714-89de-4455-97f4-f8f45267dceb","resolution":{"observed_at":"2026-08-06T05:02:24.405487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16427","last_updated":"2025-04-24T07:35:03Z","snapshot_observed_at":"2026-08-07T16:00:00.884745Z","submitted_at":"2025-04-23T05:25:13Z","title":"Can Large Language Models Help Multimodal Language Analysis? MMLA: A Comprehensive Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16427","snapshot_observed_at":"2026-08-06T05:02:24.412048Z","title":"Can large language models help multimodal language analysis? mmla: A comprehensive benchmark,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.412048Z"},"links":{"cited_paper":"/paper/2504.16427","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:5083e4f9044b2e196624860fcd06e87e16e48423138fa050a6f638e878f8e913","observation_id":"d1c5d6d0-bdc4-4b2a-8647-0b82c892956b","resolution":{"observed_at":"2026-08-06T05:02:24.412048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10179","last_updated":"2025-04-14T12:31:39Z","snapshot_observed_at":"2026-08-07T16:05:55.234100Z","submitted_at":"2025-04-14T12:31:39Z","title":"The Future of MLLM Prompting is Adaptive: A Comprehensive Experimental Evaluation of Prompt Engineering Methods for Robust Multimodal Performance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10179","snapshot_observed_at":"2026-08-06T05:02:24.417545Z","title":"The future of mllm prompting is adaptive: A comprehensive experimental evaluation of prompt engineering methods for robust multimodal performance,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.417545Z"},"links":{"cited_paper":"/paper/2504.10179","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:f58902f81d8f17be5f5312ee08e7ed02d2bb0f0ed392f0c9dc0a6c29e81557af","observation_id":"42d0d87b-261b-41e3-8ed8-a2c60f5f6119","resolution":{"observed_at":"2026-08-06T05:02:24.417545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06259","last_updated":"2016-08-12T02:39:40Z","snapshot_observed_at":"2026-07-06T05:00:39.739374Z","submitted_at":"2016-06-20T19:23:53Z","title":"MOSI: Multimodal Corpus of Sentiment Intensity and Subjectivity Analysis in Online Opinion Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06259","snapshot_observed_at":"2026-08-06T05:02:24.423638Z","title":"Mosi: multimodal corpus of sentiment intensity and subjectivity analysis in online opinion videos,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.423638Z"},"links":{"cited_paper":"/paper/1606.06259","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:03d82d9be130f068986b6d4277fb2048bbe6af77c0123a2d11fa408ccddf9154","observation_id":"b1b62d41-cbfa-452e-a7a0-e9afabb2e9b6","resolution":{"observed_at":"2026-08-06T05:02:24.423638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:30.165455Z","title":"Ch- sims: A chinese multimodal sentiment analysis dataset with fine-grained annotation of modality,","venue":null,"work_id":"fe4b4c01-3a5e-4ba9-8abc-8d615d814cd7","year":2020},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.429162Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:0b8733c0dc38a0fb081791830061af39d1e3ce95c0cd3c53ed3ea1284bab7059","observation_id":"21db1851-7af0-41ee-ba55-5898ff420f84","resolution":{"observed_at":"2026-08-06T05:02:30.238274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:30.040368Z","title":"Make acoustic and visual cues matter: Ch-sims v2. 0 dataset and av-mixup consistent module,","venue":null,"work_id":"6aba8fee-5670-42f7-a76e-8b748ff76ac7","year":2022},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.434158Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:33c84431035c1bbd57ac2cbf6ef90c6dae6513ca7bf470e4eb55983a7c4e7432","observation_id":"3309977f-1b35-4894-a074-94440234caa7","resolution":{"observed_at":"2026-08-06T05:02:30.092305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.02508","last_updated":"2019-06-04T12:33:49Z","snapshot_observed_at":"2026-07-06T07:06:12.726165Z","submitted_at":"2018-10-05T03:50:24Z","title":"MELD: A Multimodal Multi-Party Dataset for Emotion Recognition in Conversations","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.02508","snapshot_observed_at":"2026-08-06T05:02:24.438791Z","title":"Meld: A multimodal multi-party dataset for emotion recognition in conversations,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.438791Z"},"links":{"cited_paper":"/paper/1810.02508","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:af3b405b7acea1d4f902ea594534dc49977cfee914102b168ed5470794b9c01c","observation_id":"d915f76c-e091-4c4e-8496-012f69e9870b","resolution":{"observed_at":"2026-08-06T05:02:24.438791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.06618","last_updated":"2019-04-14T03:15:38Z","snapshot_observed_at":"2026-08-02T08:41:51.600809Z","submitted_at":"2019-04-14T03:15:38Z","title":"UR-FUNNY: A Multimodal Language Dataset for Understanding Humor","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.06618","snapshot_observed_at":"2026-08-06T05:02:24.443408Z","title":"Ur-funny: A multimodal language dataset for understanding humor,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.443408Z"},"links":{"cited_paper":"/paper/1904.06618","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:96eea671024437bdf7385a95526a101f87dc89b451d2b75badae9d8f91a0353e","observation_id":"0855267a-b265-4c1c-838b-74924086cff2","resolution":{"observed_at":"2026-08-06T05:02:24.443408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08387","last_updated":"2022-09-28T19:24:24Z","snapshot_observed_at":"2026-08-04T15:44:42.221453Z","submitted_at":"2021-10-15T21:58:03Z","title":"Generated Knowledge Prompting for Commonsense Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08387","snapshot_observed_at":"2026-08-06T05:02:24.447997Z","title":"Generated knowledge prompting for commonsense reasoning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.447997Z"},"links":{"cited_paper":"/paper/2110.08387","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:1985e7d200fb322bbd0cf2ebff4d0e8d0f0a0fa657b5693b1a5049a57b385165","observation_id":"fd73413d-c3a3-48cf-b9f0-4314da5146bc","resolution":{"observed_at":"2026-08-06T05:02:24.447997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:29.895417Z","title":"Self-attentive feature-level fusion for multimodal emotion detection,","venue":null,"work_id":"6672f833-92d4-46ff-9d75-f4a2dee95953","year":2018},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.452615Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:e10c4616dd887537cf374472ef7f0c9f8cc9e4e06393f17ff2e0816295b46099","observation_id":"8fc8751e-6fb9-4930-8744-859f0a979492","resolution":{"observed_at":"2026-08-06T05:02:29.971592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:29.781329Z","title":"Emotion recognition using feature-level fusion of facial expressions and body gestures,","venue":null,"work_id":"24931bd4-15d8-4a34-bbf8-0b0801f34afd","year":2019},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.457912Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:19a858b582d46f9de7f6719539db9e6c143f607ba6db936f795415feedb9704d","observation_id":"adfaf75b-99c2-44bb-a848-01b9d6828b6c","resolution":{"observed_at":"2026-08-06T05:02:29.832233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:29.638629Z","title":"Decision-level fusion method for emotion recognition using multimodal emotion recog- nition information,","venue":null,"work_id":"38dd493d-6aff-400c-b4cf-3a7bea61689b","year":2018},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.463005Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:62973a1491578b7bbc270c662acf00ba11f3571628d5a467e62b37339325507f","observation_id":"090ae2fc-4055-4976-84ac-48158ff0fd74","resolution":{"observed_at":"2026-08-06T05:02:29.705955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:29.415210Z","title":"Deep learning-based late fusion of multi- modal information for emotion classification of music video,","venue":null,"work_id":"cfbda44e-ffb7-4bf4-b3dd-1f38b0cb5a64","year":2021},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.467810Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:2b175f52d6313504bace6ac6c1421d55bafa52b3293d84f2d64a9e0b7267b678","observation_id":"1e10bca3-bf67-4ee0-9c05-2e71ca3b791f","resolution":{"observed_at":"2026-08-06T05:02:29.514991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:29.235743Z","title":"A joint cross-attention model for audio-visual fusion in dimensional emotion recognition,","venue":null,"work_id":"b6aacb6e-c702-464e-94ce-a4370552f547","year":2022},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.472652Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:5f444eb2314fc08cd1c48b70cbd28f12cd64e373a3c50bf99b8d994c92cc93d4","observation_id":"368a5029-19d1-4bcd-9ea0-746739f59219","resolution":{"observed_at":"2026-08-06T05:02:29.311160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:29.054036Z","title":"Speech emotion recognition with co-attention based multi-level acoustic information,","venue":null,"work_id":"846716a1-d030-46dd-9d34-610ef97063c9","year":2022},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.476988Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:e30a538d22b91ff4588539bca9da1a5020242f953468b731b0b943c5110ae357","observation_id":"404f1533-fea9-4bfe-a18d-5545045a8f36","resolution":{"observed_at":"2026-08-06T05:02:29.122837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09502","last_updated":"2025-01-16T12:27:05Z","snapshot_observed_at":"2026-07-06T20:21:55.366596Z","submitted_at":"2025-01-16T12:27:05Z","title":"Omni-Emotion: Extending Video MLLM with Detailed Face and Audio Modeling for Multimodal Emotion Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09502","snapshot_observed_at":"2026-08-06T05:02:24.481438Z","title":"Omni-emotion: Extending video mllm with detailed face and audio modeling for multimodal emotion analysis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.481438Z"},"links":{"cited_paper":"/paper/2501.09502","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:497a836f4a4264f28c15fd4dadf89f5e6f39478c21f12dcea756021ed74c3a13","observation_id":"b284676b-38d0-44fd-978f-2acca5ce5b4a","resolution":{"observed_at":"2026-08-06T05:02:24.481438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21480","last_updated":"2025-03-28T12:34:25Z","snapshot_observed_at":"2026-08-07T16:32:56.614880Z","submitted_at":"2025-03-27T13:12:49Z","title":"OmniVox: Zero-Shot Emotion Recognition with Omni-LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21480","snapshot_observed_at":"2026-08-06T05:02:24.486614Z","title":"Omnivox: Zero-shot emotion recognition with omni-llms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.486614Z"},"links":{"cited_paper":"/paper/2503.21480","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:d6597a049f1996afb8f91e76629920f70d89dcd1869ae549034cb69703296064","observation_id":"74964bcf-796f-4350-a856-84deb9c68674","resolution":{"observed_at":"2026-08-06T05:02:24.486614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:24.491839Z","title":"Mellm: Exploring llm-powered micro-expression understanding enhanced by subtle motion perception,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.491839Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:380ac6b0c3857c1f58536ecd5eef357f9043c8883e7f6c8b736f561ba8b39153","observation_id":"a0fec81d-4e6d-40dc-9b2f-8d553f64eefc","resolution":{"observed_at":"2026-08-06T05:02:24.491839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:24.497289Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.497289Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:6fc59a46cedf16374b190d97bab39024035abca2b30b44755f8324944e07f643","observation_id":"a3f3bde7-2787-49c7-9fca-fcaec3ec39ca","resolution":{"observed_at":"2026-08-06T05:02:24.497289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:28.851874Z","title":"Videomae: Masked autoen- coders are data-efficient learners for self-supervised video pre-training,","venue":null,"work_id":"c36ca630-80af-4298-8eae-143ba6e10d94","year":2022},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.504123Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:4900e131e8bbb51b05dd315f0653e31a7dbd6c6b68bee0b35f85f9c22c469824","observation_id":"c35e7560-2238-4b01-b812-b28bcbea21f0","resolution":{"observed_at":"2026-08-06T05:02:28.930253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-06T10:35:16.608201Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-06T05:02:24.509860Z","title":"Beats: Audio pre-training with acoustic tokenizers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.509860Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:c1096ac136570d539b05bee7b3494de536ed78fc270c5ddb50f59af4fe686b3c","observation_id":"d32b479c-3c7f-4f03-9026-72d988877b7b","resolution":{"observed_at":"2026-08-06T05:02:24.509860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:24.516633Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.516633Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:86535399d80c6344c2a0c2f1e1eef891792972edb977d84ff492594e44fafae5","observation_id":"c7731c3b-89bc-49ca-a089-6d1ee0720fdf","resolution":{"observed_at":"2026-08-06T05:02:24.516633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-02T21:51:36.809095Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-06T05:02:24.523176Z","title":"Salmonn: Towards generic hearing abilities for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.523176Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:bd0217c7b88ce9caa5336f276406ea9c158c39d4d7f12d1193faa97273197005","observation_id":"20b4fd2d-8357-4fa8-905d-821aa6e42340","resolution":{"observed_at":"2026-08-06T05:02:24.523176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-06T05:02:24.529880Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.529880Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:84be078c2ac85d1cb4bb5bc7b1ba7f8ce3a446cf20f12bd056f4613faeef62b5","observation_id":"5af11d9b-7bd0-4ea7-ac40-7c30cab0911d","resolution":{"observed_at":"2026-08-06T05:02:24.529880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-06T05:02:24.535612Z","title":"Minicpm-v: A gpt-4v level mllm on your phone,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.535612Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:727e98e56abc0f86b614949ae6d0867bfa8f68f99725e51bb78e1f9fe21f0226","observation_id":"11f2de67-3088-49d6-8256-7b9f687d8eef","resolution":{"observed_at":"2026-08-06T05:02:24.535612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15111","last_updated":"2025-01-25T07:26:37Z","snapshot_observed_at":"2026-08-07T11:56:57.969083Z","submitted_at":"2025-01-25T07:26:37Z","title":"HumanOmni: A Large Vision-Speech Language Model for Human-Centric Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15111","snapshot_observed_at":"2026-08-06T05:02:24.540778Z","title":"Humanomni: A large vision-speech language model for human-centric video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.540778Z"},"links":{"cited_paper":"/paper/2501.15111","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:57f572166d56775e0370f5ecec78f733a00b7fa0f43fcf21ea412579417ce125","observation_id":"fa56c0e6-2f13-4c61-8dc4-f259ad81b243","resolution":{"observed_at":"2026-08-06T05:02:24.540778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:28.694130Z","title":"Ola: Pushing the frontiers of omni-modal language model with progressive modality alignment,","venue":null,"work_id":"bd414612-eb2e-45f6-ae39-6ad33ff06bb3","year":2025},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.548636Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:9f4de7c4e4c4a3c7f6889da99855c26f349d4ef7489b24c06d8a7d5da7fd2e5d","observation_id":"a779eae7-fa98-4831-9eb1-a1dd5b7829b9","resolution":{"observed_at":"2026-08-06T05:02:28.768680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-06T05:02:24.555547Z","title":"Qwen2. 5-omni technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.555547Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:8ddab45e6a092bd93a6e11410ddc80aff4cbf3fe10eddaf41615ba0965205fd6","observation_id":"ce2dff1b-3623-49ca-8b58-96642e13d7f8","resolution":{"observed_at":"2026-08-06T05:02:24.555547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:28.546493Z","title":"Learning emotional prompt features with multiple views for visual emotion analysis,","venue":null,"work_id":"f2d34a86-b8c9-4cc6-8b85-c69b90de77bd","year":2024},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.563409Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:c107dec5de4a1dc4345c3a27b7a7db81d4d7930a6417943ba86155b1fbb1e4b9","observation_id":"23714ce4-ca41-49be-a199-fdb7fe05d0c0","resolution":{"observed_at":"2026-08-06T05:02:28.612232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:28.406192Z","title":"Visual and textual prompts in vllms for enhancing emotion recognition,","venue":null,"work_id":"be44786c-ca73-4200-812a-9c5b418a12c4","year":2025},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.570432Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:14119a7e260a4664fca4ea0989c1f05e87f7a14f0eb5795707ad12f62d1d9c07","observation_id":"fd4ab5fb-87cc-402c-988d-3457955a13c0","resolution":{"observed_at":"2026-08-06T05:02:28.478909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:28.227607Z","title":"Multimodal language analysis in the wild: Cmu-mosei dataset and interpretable dynamic fusion graph,","venue":null,"work_id":"2f409388-4f39-4f8d-ada1-49550f7f286f","year":2018},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.578864Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:f9c38c8a9f3e2749d45103d5f94099ad1d2f1747356c89403e6f925a7d3ba786","observation_id":"86ed16c1-d44c-4cd9-80cf-0b421f060ff1","resolution":{"observed_at":"2026-08-06T05:02:28.328838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-06T05:02:24.586681Z","title":"Videollama 2: Advancing spatial- temporal modeling and audio understanding in video-llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.586681Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:e0fc5d939005d54f6e7b3df4bcd8b4777ae48695401ad3028f6f563efd1d5b3e","observation_id":"b4ec7c38-d45f-40db-9361-da55708317ab","resolution":{"observed_at":"2026-08-06T05:02:24.586681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:28.067368Z","title":"Emotion-llama: Multimodal emotion recognition and reasoning with instruction tuning,","venue":null,"work_id":"cc017601-330f-49e3-bb3d-c63dda61ab1b","year":2024},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.593485Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:a310277e2cce7ec51538791ff636bafeafafd599723121007ad4ee224973abb0","observation_id":"0dd638df-6b46-4131-9a35-4098b317b9dd","resolution":{"observed_at":"2026-08-06T05:02:28.130166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16355","last_updated":"2023-05-25T04:16:07Z","snapshot_observed_at":"2026-08-02T07:50:35.580500Z","submitted_at":"2023-05-25T04:16:07Z","title":"PandaGPT: One Model To Instruction-Follow Them All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16355","snapshot_observed_at":"2026-08-06T05:02:24.597936Z","title":"Pandagpt: One model to instruction-follow them all,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.597936Z"},"links":{"cited_paper":"/paper/2305.16355","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:1f75e0feedd64d4308832086a28406299a14193b31ea6e0cfb6d6ef87655d6ea","observation_id":"a138cafe-fb39-4808-a7e6-ba7c95b95a7d","resolution":{"observed_at":"2026-08-06T05:02:24.597936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:27.908707Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":"3c4733cc-aaa8-440e-8c05-0615469e9b77","year":2022},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.602861Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:67c6752d94d069ab22873cffe43bdb7b7f133bd728c120109b4bfcc9c14e9e75","observation_id":"42933506-5da1-4470-bf52-7a1a9093cb09","resolution":{"observed_at":"2026-08-06T05:02:27.979157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:27.760550Z","title":"Multimodal information bottleneck: Learning minimal sufficient unimodal and multimodal representations,","venue":null,"work_id":"a7144eee-128b-444a-87ca-506e131cb475","year":2022},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.608419Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:b0cb36f9594b03e94bfceb4ba471c3a08e012ac28f49aea2eeff27d0ce495e18","observation_id":"23935ab7-5e3e-4cd0-bf5e-dfdfc236d63f","resolution":{"observed_at":"2026-08-06T05:02:27.838128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:27.625525Z","title":"Injecting multimodal informa- tion into pre-trained language model for multimodal sentiment analysis,","venue":null,"work_id":"c9228c4d-7f13-4c89-ac5a-ac7d4e08403a","year":2025},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.614031Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:3e37750d72baa2f5eccb2b7d545d06a1bc59c1d74f6d22355f1d1e6be9de8af5","observation_id":"f4ade031-da1b-491c-a62b-695a1d283a13","resolution":{"observed_at":"2026-08-06T05:02:27.684303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12151","last_updated":"2025-07-07T16:31:28Z","snapshot_observed_at":"2026-08-07T16:01:45.484833Z","submitted_at":"2025-04-16T15:00:06Z","title":"Towards Explainable Fusion and Balanced Learning in Multimodal Sentiment Analysis","version":2},"cited_work":{"arxiv_id":"2504.12151","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12151","snapshot_observed_at":"2026-08-06T05:02:25.025404Z","title":"Towards Explainable Fusion and Balanced Learning in Multimodal Sentiment Analysis","venue":"cs.LG","work_id":"fda9e7ed-97f2-48fa-85a5-abf7385b32f3","year":2025},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.619395Z"},"links":{"cited_paper":"/paper/2504.12151","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:0fb33822decb5763a68b44f30feb1d23fd6ddaa6a7ee550d201c3dfeebfe62aa","observation_id":"9364ce03-6343-4e38-8aba-e1f5a2243737","resolution":{"observed_at":"2026-08-06T05:02:25.031605Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:27.444695Z","title":"Hgtfm: Hierarchical gating-driven transformer fusion model for robust multimodal sentiment analysis,","venue":null,"work_id":"d2bd4f68-26bd-48c1-aed8-a91a3dce28a2","year":2025},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.624420Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:83d518d30630d9e67c92dfa3c88e888b7b2a4271377486fd1b7d1123fe4061a8","observation_id":"07d8b9bb-8567-4c82-b9d9-4716b492c995","resolution":{"observed_at":"2026-08-06T05:02:27.533321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07694","last_updated":"2024-08-14T17:50:27Z","snapshot_observed_at":"2026-08-04T12:26:35.417808Z","submitted_at":"2024-08-14T17:50:27Z","title":"End-to-end Semantic-centric Video-based Multimodal Affective Computing","version":1},"cited_work":{"arxiv_id":"2408.07694","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.07694","snapshot_observed_at":"2026-08-06T05:02:24.990661Z","title":"End-to-end Semantic-centric Video-based Multimodal Affective Computing","venue":"cs.CV","work_id":"87ef4319-60e3-4ff7-9114-3442b9425d8d","year":2024},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.630238Z"},"links":{"cited_paper":"/paper/2408.07694","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:1f0ed68747b94cee348217fa80182ef93aafe4fdf5644f022b323f3f818e7cba","observation_id":"19298fd8-686c-4506-ab67-daa8ca63f8cf","resolution":{"observed_at":"2026-08-06T05:02:24.999298Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-06T05:02:24.635326Z","title":"Llamafactory: Unified efficient fine-tuning of 100+ language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.635326Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:99a8127e02064b7048808ddc31974b01a08c1ac345276323359e7ea78a823040","observation_id":"721e03b3-f413-49f6-b0d5-41838fea01f9","resolution":{"observed_at":"2026-08-06T05:02:24.635326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-06T05:02:24.641304Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.641304Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:136c150c9acdc580608cf2bf028ef8353f2a4bdc39ed6103c9949d03569e19e5","observation_id":"50dd4fc4-8c65-4259-999c-7920a4cd450d","resolution":{"observed_at":"2026-08-06T05:02:24.641304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:27.271472Z","title":"Divide, conquer and combine: Hierarchical feature fusion network with local and global perspectives for multimodal affective computing,","venue":null,"work_id":"4ff0d20c-013e-479c-8b3c-8e476ad59cf5","year":2019},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.647280Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:667fc39923ceb6ba983c890218d4a88d99ae391140392d98587fc1a567d794d6","observation_id":"ef9dcab4-4f63-40a7-a256-d0d59273805d","resolution":{"observed_at":"2026-08-06T05:02:27.338026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-06T05:02:24.652010Z","title":"Qwen2. 5-coder technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.652010Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:76549e98471ebf1f4010f7be150c90594b82c07f31a22bd5dee50ae9a7cdf9c4","observation_id":"e1fd8b1b-21fa-48b1-9fa3-0f4edd6ef6ae","resolution":{"observed_at":"2026-08-06T05:02:24.652010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:24.657476Z","title":"Robust speech recognition via large-scale weak supervi- sion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.657476Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:28bebefdffc498958407c1a91f5a4dcb6f828ffde3d961110baef7888699baf6","observation_id":"85140fb3-e5f7-4992-910b-cca5bdd125be","resolution":{"observed_at":"2026-08-06T05:02:24.657476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T05:02:24.671751Z","title":"Qwen2. 5-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.671751Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:9817d90957c91c8f11c2074850671ffa28e2d10557dd07fd61bd679a64fcd8b6","observation_id":"8c2e31f1-ad87-48ef-89f8-083ee16eb6b6","resolution":{"observed_at":"2026-08-06T05:02:24.671751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:27.085378Z","title":"A survey on vision transformer,","venue":null,"work_id":"218dd95b-df5d-4389-b4d9-3c5e0d44772e","year":2022},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.677944Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:d98aabc65f7c16dd605eab2d2aa5723547e658f247dbf30836c77c3a172e90d7","observation_id":"4f549136-c179-4339-8972-b9a90ce551b8","resolution":{"observed_at":"2026-08-06T05:02:27.174956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:26.933098Z","title":"Sigmoid loss for language image pre-training,","venue":null,"work_id":"84e41651-517d-4b21-b9c3-3c01faff363c","year":2023},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.683813Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:b3284a67e5a92cc3eac9bac10bbd140160a502e3885a61dcb8d490c73ef8359c","observation_id":"4e5f5b46-67cf-4e38-9266-19f98ad5916a","resolution":{"observed_at":"2026-08-06T05:02:27.008775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T05:02:24.688796Z","title":"Llava-onevision: Easy visual task transfer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.688796Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:1f650d32c410c287e864d7bb6ccdb2acf75b1b1d2e27e2518323f28449bd0c6f","observation_id":"8b1132f2-adf1-4797-9d46-f0ba22dcad40","resolution":{"observed_at":"2026-08-06T05:02:24.688796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12961","last_updated":"2025-02-27T06:09:46Z","snapshot_observed_at":"2026-07-06T19:18:17.523057Z","submitted_at":"2024-09-19T17:59:51Z","title":"Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12961","snapshot_observed_at":"2026-08-06T05:02:24.696608Z","title":"Oryx mllm: On- demand spatial-temporal understanding at arbitrary resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.696608Z"},"links":{"cited_paper":"/paper/2409.12961","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:5e5d8d375b48078a6151b723bace8b8cc39e663bc7d7400a7d48d41086b27e1a","observation_id":"b95fbbae-b9c3-43f3-8cf9-7f2c29168dbd","resolution":{"observed_at":"2026-08-06T05:02:24.696608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-06T05:02:24.703321Z","title":"Qwen2 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.703321Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:825905def80088b89617dcd17c5e463871bbea3c273027f047347e32b577d902","observation_id":"39714fe6-3995-4275-b61f-95aee8211602","resolution":{"observed_at":"2026-08-06T05:02:24.703321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:26.743653Z","title":"Imagebind: One embedding space to bind them all,","venue":null,"work_id":"755d2f63-c296-4a50-ba8e-b7120d2dfccc","year":2023},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.710416Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:6101bb881b0aad44809b2e7094b1b68158170f0b377b2020127e5ecfa75fa825","observation_id":"5548e265-db02-49f1-82f6-2416ffd59237","resolution":{"observed_at":"2026-08-06T05:02:26.848544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:24.717254Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.717254Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:afe004f5dacb8bbda1d02c7852e44ba831859986c8b0b466965047a183cc602c","observation_id":"3fa0f8c0-2f9e-4206-a2a3-56bda65f93b1","resolution":{"observed_at":"2026-08-06T05:02:24.717254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:26.503615Z","title":"Mae-dfer: Efficient masked au- toencoder for self-supervised dynamic facial expression recognition,","venue":null,"work_id":"0faaf1ff-cdfc-46b9-b1dd-fc42335a37f2","year":2023},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.723159Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:2a7f390f50414fb65aa7c6849ac3ea1a2a83b5c5995cb59cfe22d7ac6a36f4b0","observation_id":"263337ce-aea8-41fb-9da2-b727ba36fc0d","resolution":{"observed_at":"2026-08-06T05:02:26.617560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:26.297250Z","title":"Eva: Exploring the limits of masked visual representation learning at scale,","venue":null,"work_id":"ad9e0d6e-c2fe-44cd-b761-4a781b960e25","year":2023},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.730210Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:31be22d8f62537f2559f814f7007929d4a435dadecfe287211a93a9d82c1bb02","observation_id":"0b18373b-846d-452e-9c72-040a0914caa9","resolution":{"observed_at":"2026-08-06T05:02:26.349226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T05:02:24.737622Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.737622Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:4fb1be4b25d811544b9b6f0af37668c6a370f02389fd4b9ad00bddd80d766c7e","observation_id":"74da8b45-edc1-4c74-897f-a14243688431","resolution":{"observed_at":"2026-08-06T05:02:24.737622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:26.123451Z","title":null,"venue":null,"work_id":"a50aec2f-5051-44f0-9f1d-6d5235cf1d3a","year":null},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.743337Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:a147656ee9b2e9702c2593e867683ed8e5fc93ae028ba26516b630c884be6355","observation_id":"cde85087-202c-4242-87b8-d29ff4cbc18a","resolution":{"observed_at":"2026-08-06T05:02:26.217538Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:25.932857Z","title":null,"venue":null,"work_id":"85ef9f4f-fcd4-4687-b221-57451b30fca4","year":null},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.755334Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:ee0ac7efaae1a2feecc43a1efedd2e7f6e4b3faf8313a7c9c94a52dcf034e989","observation_id":"917be28d-0b19-4dab-b624-cd745e496966","resolution":{"observed_at":"2026-08-06T05:02:26.031375Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:25.851001Z","title":null,"venue":null,"work_id":"af581acf-f8d9-4d89-b43c-4b4332d51af1","year":null},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.762492Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:97b06b269dea5a8c53c33c9438ebf720c3805a397ac51ff2e39cb4636a588d74","observation_id":"311dbcf4-fc63-4d0f-8ad0-e80cfbc0cb9b","resolution":{"observed_at":"2026-08-06T05:02:25.873698Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:25.810949Z","title":null,"venue":null,"work_id":"e4f4f239-720c-476d-ab58-ba01bd774b14","year":null},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.768191Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:fad5d33c3d2f2fe5d7f7187d128165e1ac6043af36d202e9f06b965de2fd8c40","observation_id":"abe15f6e-c07c-4049-80bb-ed134b901b3a","resolution":{"observed_at":"2026-08-06T05:02:25.826168Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:25.773032Z","title":"Its core architecture follows the Thinker-Talker design","venue":null,"work_id":"36866562-2374-4d34-a9cc-74b7d4875f1d","year":null},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.773095Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:7297483ff06ccda80fcfe198184f9e026a4e260568d1612afeb0864cdc3334c9","observation_id":"99597bf0-f020-44c7-84c0-680b7b5a62ee","resolution":{"observed_at":"2026-08-06T05:02:25.786279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:25.731653Z","title":"Its key innovation lies in the ability to simultaneously process visual and speech information in human-centric scenes","venue":null,"work_id":"afefdd27-0493-46b5-b76a-f5b0889a8109","year":null},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.778729Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:22051d12053fe28ef94827126f87f800699a1886cd107bd243ad9932b10ec123","observation_id":"27a231c1-e83b-44f8-b2fd-748b9bd889d0","resolution":{"observed_at":"2026-08-06T05:02:25.746097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T21:46:10.432808Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting"},"reference_resolution":{"displayed":74,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":2,"verified_fuzzy":33},"total_outbound_references":74},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 74 of 74 outbound references and 2 inbound Pith citation observations for arXiv:2508.02429."}