{"as_of":"2026-08-09T09:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:42e6e90c00af6bb5b960207c26805d9c127aebe5e413c29d71bb44718b883cb8","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T17:13:08.107303Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.16859/citation-record","integrity":"/paper/2508.16859/integrity","json":"/paper/2508.16859/citation-record.json","paper":"/paper/2508.16859"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.399227Z","title":null,"venue":null,"work_id":"92e4a469-30e9-4b1a-93f6-38cecf2a71ba","year":2021},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:05.519731Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:dec076e227643b31031df15065fc6d0ac08aa1bcd71e2a866847c65df6fef47d","observation_id":"e75e522c-c8c2-4c84-b273-6da53fb2f435","resolution":{"observed_at":"2026-08-05T17:13:09.405146Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T17:13:05.587946Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:05.587946Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:f36e1bed75c93b46a410d45a3996c144cb3a0513aa084aac9e565910c7f7b138","observation_id":"732e1f94-5e98-47cc-bc01-bbc20db84576","resolution":{"observed_at":"2026-08-05T17:13:05.587946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:05.677868Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:05.677868Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:fe640e061cdc1c58aaa90aba4345cfe8612fa1e2613d100482b4f8b37e0be8bf","observation_id":"4dda1526-ef3b-402d-807b-5b0c46585244","resolution":{"observed_at":"2026-08-05T17:13:05.677868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.372665Z","title":null,"venue":null,"work_id":"7bbede0f-fce1-449c-ab2d-66812937ea89","year":2008},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:05.847913Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:8b0cbf963cc2cbc30b60da44b1b600b8727ed805207a4545e2b62c6fde746795","observation_id":"c14a31b1-1777-4449-b8c5-8be6b6a481cd","resolution":{"observed_at":"2026-08-05T17:13:09.376845Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-05T17:13:05.984791Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:05.984791Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:605bbbedf7ef8317972cbac7983544ae1c89d65e9aff76cf14c2c9a39e181b00","observation_id":"ea14db05-ebb2-4935-96bc-d8559c0b8a65","resolution":{"observed_at":"2026-08-05T17:13:05.984791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11161","last_updated":"2024-11-02T02:30:50Z","snapshot_observed_at":"2026-07-06T18:31:53.591578Z","submitted_at":"2024-06-17T03:01:22Z","title":"Emotion-LLaMA: Multimodal Emotion Recognition and Reasoning with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11161","snapshot_observed_at":"2026-08-05T17:13:06.075857Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.075857Z"},"links":{"cited_paper":"/paper/2406.11161","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:df45ba94c362cf20963739b5019f9a7c91cf01d613a6aaa7f46670a0e1e8842a","observation_id":"7d1d0059-2042-4cb1-a8b4-f272ef124b2b","resolution":{"observed_at":"2026-08-05T17:13:06.075857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-05T17:13:06.159347Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.159347Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:01c678a69ce58652f351705f11bfa61ec42ee4ddc353052f66357e2d541415bf","observation_id":"3fb0cb53-2ed0-415a-aa46-bd73c21f8650","resolution":{"observed_at":"2026-08-05T17:13:06.159347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:06.249665Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.249665Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:752c1b09ddb457f69ee406d79ba70cabb6ea13c5359ef4be715084f450ea3221","observation_id":"389c554b-6ab4-480a-b2d1-a12f5e6c38ec","resolution":{"observed_at":"2026-08-05T17:13:06.249665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.343201Z","title":null,"venue":null,"work_id":"7cfb9ccf-d0e1-4260-85a7-20b5c3c7302a","year":2015},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.339759Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:ec81cc18541d7cb59d95bd8fdeb4965984d067a546f034b5385185a90cf7d531","observation_id":"834c21b6-ab2e-4bd9-af3e-f62c90727602","resolution":{"observed_at":"2026-08-05T17:13:09.349201Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15425","last_updated":"2022-11-20T14:43:36Z","snapshot_observed_at":"2026-07-06T14:23:58.242960Z","submitted_at":"2022-11-20T14:43:36Z","title":"FAF: A novel multimodal emotion recognition approach integrating face, body and text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15425","snapshot_observed_at":"2026-08-05T17:13:06.434869Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.434869Z"},"links":{"cited_paper":"/paper/2211.15425","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:6cdb5de584fa01a11385eed3494a1b6af8d2b54ce6f7221700615975b1983bb3","observation_id":"9423a914-4a6d-4979-b516-5f7de9fdf164","resolution":{"observed_at":"2026-08-05T17:13:06.434869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.321279Z","title":null,"venue":null,"work_id":"019e085e-ce68-4edd-8de0-13b3ea0822b2","year":2023},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.518257Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:7e5af46025d81fe4a9658880d66b1f4a038051604da2d4b8f5c9d03cb5f5a786","observation_id":"7526809b-5f9a-4e0e-951a-96f68c70e254","resolution":{"observed_at":"2026-08-05T17:13:09.326489Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:06.604599Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.604599Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:987f0192a46ed3a8f7224cf8d73e4d760a5abf1191cfa37939c6e97313a01442","observation_id":"cd084c4b-d8e8-49fe-9c16-a237190f0a39","resolution":{"observed_at":"2026-08-05T17:13:06.604599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.275086Z","title":null,"venue":null,"work_id":"5076e27d-de9d-4d33-b587-a137dd126cb3","year":2024},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.790027Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:a28d120f8720ad062dbdecb5b937e4cd88f5241a0654428bd0a5e4b9de394a71","observation_id":"e8092681-94dc-40b0-8456-ce6400790b09","resolution":{"observed_at":"2026-08-05T17:13:09.279266Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.261406Z","title":null,"venue":null,"work_id":"f08067c7-70cd-4016-bc79-e76dda4088e2","year":2021},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.897082Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:ca4ed34df61f41fcff743af0a170cf4a6b4d760263f833ed04248be187cf7890","observation_id":"e1f913b8-5ff0-4683-9cb7-5082f7a26c48","resolution":{"observed_at":"2026-08-05T17:13:09.265217Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.248357Z","title":null,"venue":null,"work_id":"eff2607d-f05e-402c-acd3-0880d4b59a82","year":null},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.979671Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:a085b0c0c0c42f7275a1abd632b033ec7c91bab9c27534c81e0a11cbde512bd4","observation_id":"48e4de2f-2bac-468e-b87f-b901afcbe757","resolution":{"observed_at":"2026-08-05T17:13:09.252376Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.223882Z","title":null,"venue":null,"work_id":"243d4105-e782-4019-9d3d-e2cbcf7378e5","year":2022},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.148606Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:e743212bedb6f846680bbb536a598b3d615e40a4b64e131227eae0943d1d0db6","observation_id":"57a4fba6-d9f5-4bc1-b7e8-c569f7a54ef6","resolution":{"observed_at":"2026-08-05T17:13:09.228001Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-05T17:13:07.219278Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.219278Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:85e69e472a499f8f1b8df0d8e2551c4cca7a140a62ccbbe10f202e850aa68269","observation_id":"97f4482b-5d9d-4a45-a65e-b6bb2c3bb729","resolution":{"observed_at":"2026-08-05T17:13:07.219278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:07.338230Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.338230Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:82f8f7d1f0a4af2133691c445e2ce57a31d7dc9f00b6b5bac309ba6bcf69ac69","observation_id":"b75ecfab-c9bb-4931-b3dc-f3a637a9883b","resolution":{"observed_at":"2026-08-05T17:13:07.338230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.201295Z","title":null,"venue":null,"work_id":"3437bfb7-d409-48e3-bf5e-001cfa7cd0d2","year":2024},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.427655Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:debdbb2e53c51a921f1f631b81ea5aa6dcb069d777de93ea5261e8fca2521af3","observation_id":"5b542ac3-282c-4872-84e4-c8b7310b6dbc","resolution":{"observed_at":"2026-08-05T17:13:09.205438Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.180992Z","title":null,"venue":null,"work_id":"e3fd4004-77d1-4d19-bbc8-ac0f8e32bf5c","year":2024},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.519452Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:514cd70f1834c0996a56550c5f3550c6b7da58888eea3803e881ec07d64468d7","observation_id":"4c5aefc1-623a-4970-a569-9fe9be5a3258","resolution":{"observed_at":"2026-08-05T17:13:09.185959Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T17:13:07.599560Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.599560Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:cdb2ddfb31fd64a722f9ce4a44309f1943d8a429e7f89c3010e671c6210fa614","observation_id":"15ecf628-7c09-4a99-a955-bc2e90e71ac8","resolution":{"observed_at":"2026-08-05T17:13:07.599560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-05T17:13:07.701705Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.701705Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:ac1ac4fcaa279711aff8513cff8c39ffebc13bb04eb8356b42079002fc2fd2ff","observation_id":"844db2a6-5923-467f-8af6-5b798541e1dd","resolution":{"observed_at":"2026-08-05T17:13:07.701705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01552","last_updated":"2024-09-03T02:42:39Z","snapshot_observed_at":"2026-08-06T05:48:06.879547Z","submitted_at":"2024-09-03T02:42:39Z","title":"Self-Instructed Derived Prompt Generation Meets In-Context Learning: Unlocking New Potential of Black-Box LLMs","version":1},"cited_work":{"arxiv_id":"2409.01552","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.01552","snapshot_observed_at":"2026-08-05T17:13:08.689835Z","title":"Self-Instructed Derived Prompt Generation Meets In-Context Learning: Unlocking New Potential of Black-Box LLMs","venue":"cs.CL","work_id":"409544f7-6080-48fd-8d6e-67668de8a8f2","year":2024},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.786044Z"},"links":{"cited_paper":"/paper/2409.01552","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:5be1d81925e659d0a4b9a668745509803c55a6ddaad93187dda33072ea23dad5","observation_id":"3434fa3a-3bf1-427a-8c51-5f56facb69cc","resolution":{"observed_at":"2026-08-05T17:13:08.747954Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.02359","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.432155Z","title":null,"venue":null,"work_id":"36498013-2cf4-4337-8090-19e84a4d63f4","year":2025},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.871461Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:13156049fc907db34a9b3898e97be11959394440b4b716e877bf071e870089f4","observation_id":"23f79d68-a403-4e9c-8294-634ec395614a","resolution":{"observed_at":"2026-08-05T17:13:08.570440Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.167411Z","title":null,"venue":null,"work_id":"e555fc7f-1dd4-455a-92ae-a90b1b82bd88","year":2025},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.948496Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:0a7a7544a6739cc2e78b4d59a9d61d3f0d79c3a7ae720550ad6ffa1ae9059c8d","observation_id":"67d925de-95e6-45a5-9545-3177c2eea541","resolution":{"observed_at":"2026-08-05T17:13:09.171211Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-05T17:13:07.952264Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.952264Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:186c7d7d41c12bae5ba93795e96bb5c1ff5245001a4577043dcff604ea7d7b11","observation_id":"51be394a-5e20-43b7-b812-11292e92281f","resolution":{"observed_at":"2026-08-05T17:13:07.952264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.156003Z","title":null,"venue":null,"work_id":"a1466e56-0363-4cdc-ab22-ec697ef3e782","year":2024},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.955910Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:f076c4dfa4c7e438118c10f1d826c9ec80344ed0d30d86e99ac2962486183ad2","observation_id":"1f9b4e37-a444-4bba-acd3-a1446d479532","resolution":{"observed_at":"2026-08-05T17:13:09.159587Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.142837Z","title":null,"venue":null,"work_id":"9837a7a2-1013-4650-a6f3-e7d3f9148086","year":2019},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.959404Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:6624bb63be7e4e403b69e6bcaf78ae3ef7ba04295ab037349cf0e2e45b370867","observation_id":"88489a0b-8494-45e7-aacf-66cd7114ca4e","resolution":{"observed_at":"2026-08-05T17:13:09.146731Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.132246Z","title":null,"venue":null,"work_id":"789c6575-d312-40c4-9fb1-898e8c01837c","year":null},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.962699Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:c3c8c1a1d6ca465f6695dd8628838c628c08789a6b29b9feed0795d6c6dec05a","observation_id":"79c268f5-c947-4a8e-8f28-7abb20b5a7ef","resolution":{"observed_at":"2026-08-05T17:13:09.135759Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:07.970121Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.970121Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:37c7b838a10ca8b6dbf4961ece8fa38f818e5013047e8a7c14bcc107881cb1f5","observation_id":"b32b4851-901d-4c58-9ae7-bbab845eeaf3","resolution":{"observed_at":"2026-08-05T17:13:07.970121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.112363Z","title":null,"venue":null,"work_id":"91ec0b0a-8fed-4cf9-8e5b-74882cf02001","year":2023},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.977741Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:c0f39cda89c2cc8a8c890dee4be225c481348e40c2d0dc63960df6fc019b49f3","observation_id":"45cc20b3-ad38-427a-a114-974f9ab5345f","resolution":{"observed_at":"2026-08-05T17:13:09.115577Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.101356Z","title":null,"venue":null,"work_id":"d9bc0578-3860-4c55-a259-b9e7ffb8b0f5","year":2011},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.981524Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:6c2a2071e44d91262598f365f47d67e8cf69ab082817c2f8c9d7891dc068a798","observation_id":"464776f6-f0ba-4b44-822c-6e8ed17e1785","resolution":{"observed_at":"2026-08-05T17:13:09.105075Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.089890Z","title":null,"venue":null,"work_id":"d9e78b7a-ee75-4ad3-9072-f198e17f66d6","year":2020},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.984928Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:f22e726ed4db5961648d17fb33ce692c60bf0637f3ef858ceea352d523f7e600","observation_id":"cc12e840-1167-461f-8104-8d71b4769d88","resolution":{"observed_at":"2026-08-05T17:13:09.093858Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.079301Z","title":null,"venue":null,"work_id":"ccb406a1-4c30-43e2-9cd8-4bfe084119e3","year":2023},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.988284Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:e65131a86b6f36d2f445115076c55fe18d0702a0478cc37d5c17d37fb726f2a9","observation_id":"8057417f-4cb4-417b-b978-e8b9406bddae","resolution":{"observed_at":"2026-08-05T17:13:09.082632Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.068385Z","title":null,"venue":null,"work_id":"05cd8fe4-4d6e-4172-9081-201b15d93742","year":2019},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.991584Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:51d600a3392074ed069a98d1a87d47a713964cded7dcc87e5cce922305a8f761","observation_id":"1a4ea820-0336-4651-aa1f-c3cf0880eb1c","resolution":{"observed_at":"2026-08-05T17:13:09.072023Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:07.994833Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.994833Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:7a8df0147921595de0da37cab95909804995a13986520e6b553c5856061da1f5","observation_id":"6203de18-52cb-4342-baa2-eae99658d5c9","resolution":{"observed_at":"2026-08-05T17:13:07.994833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00207","last_updated":"2019-08-28T21:35:38Z","snapshot_observed_at":"2026-07-31T15:34:21.257195Z","submitted_at":"2018-11-01T03:43:10Z","title":"Towards Empathetic Open-domain Conversation Models: a New Benchmark and Dataset","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00207","snapshot_observed_at":"2026-08-05T17:13:07.998728Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.998728Z"},"links":{"cited_paper":"/paper/1811.00207","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:910e68da063610231125a243bb8c4620c0594a62b9b9171c84032d5cb0d3bd8b","observation_id":"ef128d14-1823-4700-947e-10af4ba3c72b","resolution":{"observed_at":"2026-08-05T17:13:07.998728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.049492Z","title":null,"venue":null,"work_id":"0061bc82-9618-4070-95ec-001132c32fd8","year":2020},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.002278Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:ad64af218b4539e68be3e3bdc62e816d0d9b81946a3ac68c0e8b3e5772bbbdef","observation_id":"c5b3dbd4-ba0b-44f1-a8d1-1735c0c5e73e","resolution":{"observed_at":"2026-08-05T17:13:09.053002Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.037357Z","title":null,"venue":null,"work_id":"31b6a1aa-d6a2-4ae6-b1f7-792bafdeaa67","year":2023},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.014833Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:86ace8d84fcbfab82530e337182adae579eaef1a9f5beb6d3abcfe1a03192e2d","observation_id":"6dbf51d2-2898-4f35-a9dd-aab0055580c5","resolution":{"observed_at":"2026-08-05T17:13:09.040652Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.025658Z","title":null,"venue":null,"work_id":"ca867295-0d83-4d9b-88b4-324962e5b6d3","year":2024},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.019187Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:0ec1b39d080242a96ffcfdeb0a9a1748eec66b5d18bac29983f485a24e6d4e50","observation_id":"a2579fbc-4067-465d-a20e-425d7bc0a2b8","resolution":{"observed_at":"2026-08-05T17:13:09.029401Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.012928Z","title":null,"venue":null,"work_id":"494d080f-f1bb-43fa-a1a6-b45bcfc4e033","year":null},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.022904Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:7eb5b8d5676be59da3a6425f7b65fb920da4183cf0425b233997389a693848d5","observation_id":"8e2492ce-5b92-4203-bcce-390043777933","resolution":{"observed_at":"2026-08-05T17:13:09.016573Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.990113Z","title":null,"venue":null,"work_id":"245526f0-cb1b-4232-b151-bdf1749a047b","year":2021},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.030614Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:7c8525bd80a1ab7e10dc7ff41462f801e1a5f655e134226bc8455dfead24abfe","observation_id":"69ef2ebd-6923-438e-b005-31d07e57836a","resolution":{"observed_at":"2026-08-05T17:13:08.993683Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T17:13:08.034197Z","title":"Jinpeng Hu et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.034197Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:14887b21575374d57e66ade8ccc6a94e1b048ea796fbd7dfe24796bc419d6f29","observation_id":"933620c3-3c5d-4885-90e7-20d725a97951","resolution":{"observed_at":"2026-08-05T17:13:08.034197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00133","last_updated":"2019-10-31T22:28:45Z","snapshot_observed_at":"2026-07-06T08:33:58.970043Z","submitted_at":"2019-10-31T22:28:45Z","title":"Dreaddit: A Reddit Dataset for Stress Analysis in Social Media","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.00133","snapshot_observed_at":"2026-08-05T17:13:08.038353Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.038353Z"},"links":{"cited_paper":"/paper/1911.00133","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:2d8ecc040890c5543fc441843cfaefaa8696dc3501d6e019436404ba1fd6cf64","observation_id":"c42a1013-1461-4778-8c06-b7edbd901303","resolution":{"observed_at":"2026-08-05T17:13:08.038353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.041586Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.041586Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:92ae4f5b05a75e5e874f3da5be73974d5f9da81fe9d6349769ce1cad30621f9f","observation_id":"60c8ae63-b1f4-4588-a9fd-9dc9c944d0aa","resolution":{"observed_at":"2026-08-05T17:13:08.041586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.000807Z","title":"In Proceedings of the 31st ACM International Conference on Multimedia","venue":null,"work_id":"000498db-7d5b-43cf-925e-1446f97c39f5","year":null},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.027117Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:ec0a76b96447d61011396dc8b3ea646dd72344b182e922ec4e4ebf44a3a5d21b","observation_id":"0b254268-ea50-47fc-bf5e-de1358a07982","resolution":{"observed_at":"2026-08-05T17:13:09.005138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-08-05T17:13:08.048793Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.048793Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:91f68b8163f83861c7fba611af424f1a2c78fa10a1739cdc93cb678d64b177d7","observation_id":"d20a879f-66e9-4036-854f-3cb5dc989c1f","resolution":{"observed_at":"2026-08-05T17:13:08.048793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.052613Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.052613Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:ccefd405bd02ec6abf1cba0d787a16dd788166bb92b0c4c8e3069f86ce3d3c8b","observation_id":"4aa04bef-7909-4aaa-ad1f-f75aca149122","resolution":{"observed_at":"2026-08-05T17:13:08.052613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.964807Z","title":null,"venue":null,"work_id":"bcd96e3f-634b-45f4-bd06-139134d0e639","year":2023},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.055975Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:e666ba073eddfdd8167c1868e966b193bbc6131aa53e5bf3686194e65d7fb1be","observation_id":"464434eb-7fa3-49aa-b92f-2a814862bdee","resolution":{"observed_at":"2026-08-05T17:13:08.968568Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.954214Z","title":null,"venue":null,"work_id":"aa7e6b15-7336-46c0-a4fd-857ed3273320","year":2013},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.059516Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:f7f1c25c9ffb5cfe6dab416c776315c2f540efe098b3f16d877802ac68c9ae35","observation_id":"7a3ec6cb-c905-462f-b18b-effbf3b92f70","resolution":{"observed_at":"2026-08-05T17:13:08.957414Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T17:13:08.045053Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.045053Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:bdca7ffc95a6ccac820f5e673f9a6a1bfd6c2d98e9e90a20b84b7af97aaa364b","observation_id":"ff766519-ef13-4409-af69-1826248e572a","resolution":{"observed_at":"2026-08-05T17:13:08.045053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.932156Z","title":null,"venue":null,"work_id":"e49059b1-3e52-4715-b2b7-2242a40040b3","year":2022},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.066051Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:92b862c5eda13cdd495fa45285e38d098d68815a90e17e821761f6122b88e2bf","observation_id":"9c931404-c032-46f4-9a90-45c50b555780","resolution":{"observed_at":"2026-08-05T17:13:08.935957Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12244","last_updated":"2025-05-27T06:49:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-24T16:31:06Z","title":"WizardLM: Empowering large pre-trained language models to follow complex instructions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12244","snapshot_observed_at":"2026-08-05T17:13:08.069316Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.069316Z"},"links":{"cited_paper":"/paper/2304.12244","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:3de96154890e4f2a4cb6a89d1c7848f6e0e145e034b33468cac238d303e8b72c","observation_id":"c1f4f801-25f5-4f0f-8122-70e9ec01d806","resolution":{"observed_at":"2026-08-05T17:13:08.069316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.919417Z","title":null,"venue":null,"work_id":"c345bbc2-0fac-492d-85e9-e22e6d6dadfa","year":2019},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.073087Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:6c40e9ca978944e374bd076e35b5c12f2dc1b86b9afde9d433451d9e744bc5ce","observation_id":"e703e0a0-531b-4e15-b59f-fd672a714cb3","resolution":{"observed_at":"2026-08-05T17:13:08.924061Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16375","last_updated":"2025-01-20T00:29:19Z","snapshot_observed_at":"2026-08-06T04:34:36.950710Z","submitted_at":"2024-04-25T07:29:17Z","title":"List Items One by One: A New Data Source and Learning Paradigm for Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16375","snapshot_observed_at":"2026-08-05T17:13:08.076343Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.076343Z"},"links":{"cited_paper":"/paper/2404.16375","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:8d62868b7fc394f8075ad5b0c41b1cb1729f8c01056396ca4fa0079975e0fcab","observation_id":"3da926a6-f313-47a3-954a-cc2967c60026","resolution":{"observed_at":"2026-08-05T17:13:08.076343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.943762Z","title":null,"venue":null,"work_id":"d8686491-2939-4bfb-a1a1-0f2c92b1c88f","year":2024},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.062675Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:04fb21520fa02810a31571ab005b5a42c5ef962bf9d23fac09d09431788561ed","observation_id":"0c570132-11ab-4664-9948-e5438ded5133","resolution":{"observed_at":"2026-08-05T17:13:08.946855Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.897008Z","title":null,"venue":null,"work_id":"c67965b5-935d-4abc-adff-47be306d55fc","year":2020},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.082963Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:90e7e91e8a99cac6d63fce834df8cd0a18059da8e5ce02c5af25eae48f5c0fe0","observation_id":"3834ffb0-2b29-4314-912b-e2360205980b","resolution":{"observed_at":"2026-08-05T17:13:08.900285Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.886427Z","title":null,"venue":null,"work_id":"977816c3-3816-429e-b6a7-3bcd2d040f55","year":2019},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.086241Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:44f9cdde3613d7109ec21c304b01df5a5b7c8569bbcf94eb8e1212d805a94246","observation_id":"af1430fc-e2dc-4821-89de-36a1c1cbbe52","resolution":{"observed_at":"2026-08-05T17:13:08.889585Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.875331Z","title":null,"venue":null,"work_id":"751e26a2-f63a-4940-a3e9-cb3d3e6e11e9","year":2016},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.089463Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:b33c072076bfa14d2f6a59b4a7857c8a426ae0f0815f41e0bcae19dcde4d9d47","observation_id":"5d958a74-4b47-4aa4-8f54-8267591a0503","resolution":{"observed_at":"2026-08-05T17:13:08.878670Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.864763Z","title":null,"venue":null,"work_id":"ba283c03-6ac3-45b4-97a3-1210b449ec17","year":2018},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.092588Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:edd422ab3d4663959eeea54c154edfa0556e44b464e339c31cc10dbe605c1ec0","observation_id":"0aba231a-144f-407d-8d7b-9f3456e91678","resolution":{"observed_at":"2026-08-05T17:13:08.868168Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.908022Z","title":"Chi, and Denny Zhou","venue":null,"work_id":"d379fb22-22a2-4744-a3cb-3fcb61496ba8","year":2024},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.079745Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:1d55208e6331dab8ad62ce9fb67e5d3ac70354cd85cfb673f7d3ce788bf3011b","observation_id":"19f7ab63-4b55-4b6b-af22-c367e428befe","resolution":{"observed_at":"2026-08-05T17:13:08.911889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-06T02:13:50.627750Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-08-05T17:13:08.100077Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.100077Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:b1a3e351d441a746839573458d78b2e82d26788e60b8b645e2ccb6f3412fc1f5","observation_id":"5d3013a8-c5cd-43e0-bdfe-d4519226568b","resolution":{"observed_at":"2026-08-05T17:13:08.100077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.853627Z","title":"Chi, Quoc V Le, and Denny Zhou","venue":null,"work_id":"33fa6337-ea7a-405c-a622-337ea90e8720","year":2024},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.103403Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:e709559337724e8210df3af3155a5324a73c8fc7c63b6c38ba2b3f5fdf92ffc2","observation_id":"d001ec0d-55c6-4356-9c3b-c26b15920aab","resolution":{"observed_at":"2026-08-05T17:13:08.856822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-05T17:13:08.107303Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.107303Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:7c953ca2a1af579b14e22ef248e062889b5cdd623a6aede15c8340330d4df9ce","observation_id":"92786083-b1d7-4def-9f9e-5fb5b8a4b82e","resolution":{"observed_at":"2026-08-05T17:13:08.107303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-05T17:13:08.096024Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.096024Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:cf457da1782adaf736e02e9b9ea4da54aa9d53c3cf6bc64b7430e8ae98221563","observation_id":"9f7999db-19ce-4621-af6c-b8935cf10a27","resolution":{"observed_at":"2026-08-05T17:13:08.096024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.289582Z","title":null,"venue":null,"work_id":"25f4244b-7d9c-47c7-a551-f43c4629fd16","year":null},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.704956Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:3d336d6c94ab939779d4cd676584c55700ab18ca2d1b1236590f3e14d8a0e9cc","observation_id":"1338ecd0-323a-4b3a-b8bb-c9686f3352af","resolution":{"observed_at":"2026-08-05T17:13:09.294435Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.235910Z","title":"In Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","venue":null,"work_id":"abd88e80-80ad-497b-aa3b-57510fc2ed10","year":null},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.063714Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:ef7fbf51e24a05f73777dc84485892d343be793622b369e30e465ca4c2f1105b","observation_id":"ec614a4a-9aeb-4948-a5ad-cb5d55c26644","resolution":{"observed_at":"2026-08-05T17:13:09.239747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-05T17:13:07.973742Z","title":"arXiv preprint arXiv:2306.05424 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.973742Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:d2834afeb92733e85b40cd89c92a33f7f4f5769f2108463892ccf1fb7a86571f","observation_id":"bbe44f30-f85c-43b2-ae98-ddd6a875e668","resolution":{"observed_at":"2026-08-05T17:13:07.973742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12961","last_updated":"2025-02-27T06:09:46Z","snapshot_observed_at":"2026-07-06T19:18:17.523057Z","submitted_at":"2024-09-19T17:59:51Z","title":"Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12961","snapshot_observed_at":"2026-08-05T17:13:07.966651Z","title":"arXiv preprint arXiv:2409.12961 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.966651Z"},"links":{"cited_paper":"/paper/2409.12961","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:ec7c6c33483509749f954904aaa07edbb62722e7b9044cdba5f18ede58830627","observation_id":"658ce853-647e-4c11-9558-ed2cef15393e","resolution":{"observed_at":"2026-08-05T17:13:07.966651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":63,"verified_exact":2,"verified_fuzzy":4},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2508.16859."}