{"as_of":"2026-08-05T00:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1a3021ee34a1c1e6cefa1891f881b9b31b9df6ccdcb2a51bbf5aec8dcb48eb97","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T05:06:09.216428Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T07:20:31.305011Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.27652","snapshot_observed_at":"2026-07-14T11:49:31.595873Z","title":"arXiv preprint arXiv:2606.27652 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10428","last_updated":"2026-07-24T14:32:58Z","snapshot_observed_at":"2026-08-02T07:20:28.030282Z","submitted_at":"2026-07-11T18:22:49Z","title":"Enjoy Your Talk: A Human-Centered Benchmark for Multi-Turn Dialogue with Decoupled User Simulation, Target Modeling, and Judging","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-14T11:49:31.595873Z"},"links":{"cited_paper":"/paper/2606.27652","citing_paper":"/paper/2607.10428"},"observation_digest":"sha256:84d89adfba804a85617780a14922b5083877db7baa964d043f7aecac152f2789","observation_id":"68266c49-5a3a-4795-bd62-ebf0f98734f8","resolution":{"observed_at":"2026-07-14T11:49:31.595873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.27652","snapshot_observed_at":"2026-08-02T07:20:31.305011Z","title":"arXiv preprint arXiv:2606.27652 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10428","last_updated":"2026-07-24T14:32:58Z","snapshot_observed_at":"2026-08-02T07:20:28.030282Z","submitted_at":"2026-07-11T18:22:49Z","title":"Enjoy Your Talk: A Human-Centered Benchmark for Multi-Turn Dialogue with Decoupled User Simulation, Target Modeling, and Judging","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:31.305011Z"},"links":{"cited_paper":"/paper/2606.27652","citing_paper":"/paper/2607.10428"},"observation_digest":"sha256:3a2e3011d115996d22eeeb5fce69d58e017560b6db96c32a2abb8a298ad2a448","observation_id":"2bbb0d5f-756b-4635-9656-5a9a272bd2bb","resolution":{"observed_at":"2026-08-02T07:20:31.305011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.27652/citation-record","integrity":"/paper/2606.27652/integrity","json":"/paper/2606.27652/citation-record.json","paper":"/paper/2606.27652"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:02fa60970b5c3a92deb87f325caf7435522c5a4632de2943d30d0ff61e3ef9f2","observation_id":"9aff33c2-b51f-41bf-9184-c8dfcc767c22","resolution":{"observed_at":"2026-06-29T18:23:51.448041Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-02T10:52:10.211700Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":"2601.03267","doi":"10.48550/arxiv.2601.03267","metadata_source":"pith","pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-07-11T02:17:46.480513Z","title":"OpenAI GPT-5 System Card","venue":"cs.CL","work_id":"ca87689a-0d29-4476-b504-b65dbbb08af4","year":2025},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:3e21dcfd9306cc891f6babb677b083225f81e4b2a020f7a26a67058b483adf23","observation_id":"de2ba455-3b97-41de-a5d2-8cba257e897d","resolution":{"observed_at":"2026-06-29T18:23:51.435970Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-03T00:38:11.458508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T00:38:11.458508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-03T04:23:51.274879Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2503.20215","doi":"10.48550/arxiv.2503.20215","metadata_source":"pith","pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Qwen2.5-Omni Technical Report","venue":"cs.CL","work_id":"438f105c-fa9b-44aa-ad52-43acb8045cda","year":2025},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:da79d52bd148b595c54e2492451f107bea9bbe5e865832f088c344e96401c29b","observation_id":"da7dea5b-8fed-471a-b87c-87df051a16da","resolution":{"observed_at":"2026-06-29T18:23:51.428492Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"MIT press, 2000","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:efd4af5d30df7ac56621ee4a6c29e8ef09b8bcb56df8438a759258ef0b5bc913","observation_id":"36891fd2-1076-4ede-97c3-d2a9a493e9ab","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Mer 2025: When affective computing meets large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:d3a669ebcfa512e23ad656b85a4dd882d398aa83e47f86c4ed5412ee50b705d7","observation_id":"b1f64b24-c8f1-48b5-8eae-5497ddbf82cd","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.24322","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:20:06.326002Z","title":"Multimodal large language models meet multimodal emotion recognition and reasoning: A survey","venue":null,"work_id":"a89eabef-0cd7-48f1-ac17-249d92a1a08f","year":2025},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:8e1086f1c9138e33b1573cf0d8d2890d6efafa43cc02597626b1a9ab5a2438be","observation_id":"739549d3-b542-434e-9569-12c879cf362f","resolution":{"observed_at":"2026-06-29T18:23:51.433738Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Mer 2023: Multi-label learning, modality robustness, and semi-supervised learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:78891b26a9c1814ab19656efedf02946063bdffe97011d74242859e476df8037","observation_id":"d5a39ae3-1023-44cc-9177-153db0e80cb8","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Mer 2024: Semi-supervised learning, noise robustness, and open-vocabulary multimodal emotion recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:0cb853479d7d9fd72fbad61c6664d9e0a7e5100f6abe66f9d5ef720c72c5b0a3","observation_id":"149b0958-c115-4d1c-91a7-31bd1a4c22bb","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Meld: A multimodal multi-party dataset for emotion recognition in conversa- tions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:021c3f62f9c0aabcaf134653559e5e99b12dc04506a4233984db21f25f445123","observation_id":"0a3b1def-6148-4c7c-ad5d-31bcae9cf164","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Iemocap: Interactive emotional dyadic motion capture database.Language resources and evaluation, 42(4):335–359, 2008","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:13ae767e228c697d922e47a53ce1794b82ad027b0fc11262de381d5f52f2b893","observation_id":"a8e8c97f-d239-4dda-a882-8cb2735a49e5","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Affectgpt: A new dataset, model, and benchmark for emotion understanding with multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:b5f3206dd363887bede3c9c8bedf117d80a4b561b663cc411240ae3e5e2d2a2e","observation_id":"89f16994-88af-47a2-b211-073f84fe5263","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Ov-mer: Towards open-vocabulary multimodal emotion recognition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:661bf33dbcbbbdaa21683057d57228daef6729ba563168c3e504629b19208dec","observation_id":"c3fadfbc-79e2-4d54-9d54-2c3a397acb34","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Explainable multimodal emotion reasoning.CoRR, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:6cbaeb9411882852ef18437ca2f82673d3b6f1e052df415e4b44ea41b6488f28","observation_id":"2f6721db-461d-43d1-8c0a-5fc088aaf701","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Deepseek-r1 incentivizes reasoning in llms through reinforcement learning.Nature, 645(8081):633–638, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:e509cbfcf71f06dea30290209f8c8be9eb484de5f57f454b1dc10d165d296672","observation_id":"a148fa02-2a7b-4c76-8a9c-b6148e7d5db1","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.01318","doi":"10.48550/arxiv.2508.01318","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Affectgpt-r1: Leveraging reinforcement learning for open-vocabulary multimodal emotion recognition","venue":null,"work_id":"5c280e1b-cbf3-4031-89e8-89c5b0f8e170","year":2025},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:88a30127a02236407283b59afef9b8fd5c5220873d9bfe01931504a5c50ac2ad","observation_id":"5641f6ad-3fb5-42ed-b9ed-ec256e5c27dc","resolution":{"observed_at":"2026-06-29T18:23:51.445768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-07-06T21:48:02.821178Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":"2506.21277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-07-04T19:20:06.286106Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context","venue":null,"work_id":"8dd6d299-b8a6-4979-86fe-431ec0644784","year":2025},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:f025b92d598fa999fc3ab9bca9ef8b23b4153831bc045db165bb95e62792ac5c","observation_id":"db441dfa-501f-404a-b6d7-55eb6216d76b","resolution":{"observed_at":"2026-06-29T18:23:51.450720Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"From system 1 to system 2: A survey of reasoning large language models.TPAMI, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:3ca0037f0893f20f5fa73e485be388d6021f6671b679785becc233748195eaaf","observation_id":"82ae2464-03d4-4626-b2e2-5586145176f3","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2509.17765","doi":"10.48550/arxiv.2509.17765","metadata_source":"pith","pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Qwen3-Omni Technical Report","venue":"cs.CL","work_id":"ae43e594-8bab-4471-b6af-92a300f6a048","year":2025},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:3c9a6f386c79ac63baf61a4959b40c0d31b99e0bfef843cff67a8b3cfc83648e","observation_id":"c1ffc9ea-2473-40d3-a7e7-3bcce07f176e","resolution":{"observed_at":"2026-06-29T18:23:51.438414Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:da86818c6c5e98abe160ad1d8889839f0aee4b1c044711a1e10430859a7ad89a","observation_id":"32e8cc38-a9dd-45db-afbd-d7a8773aa399","resolution":{"observed_at":"2026-06-29T18:23:51.440715Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Visual instruction tuning.NeurIPS, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:947bc569afea76806510041e796f95f260b7774d0efec8e52ea71d20af355941","observation_id":"36323b14-11e6-4772-aa21-c36b39b7dd61","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Parallel diffusion solver via residual dirichlet policy optimization.IEEE TPAMI, pages 1–17, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:9df2252c3da5cc9991ead9c302bc70381d95509379c18b303aa4cea873133d6f","observation_id":"4a50014c-ef68-4ab3-ae6c-ac2796c2a43e","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-07-06T20:49:56.018809Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.07365","doi":"10.48550/arxiv.2503.07365","metadata_source":"pith","pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","venue":"cs.CV","work_id":"eda3a54e-ebd6-40bd-af17-b567ea4c5d62","year":2025},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:e9e77ac0a58bfa2427b7d35dd9e0f51ae4217264bd5e5feaff147dae822c885c","observation_id":"14bfe3fd-5aa8-4dd0-98d8-9b993342d188","resolution":{"observed_at":"2026-06-29T18:23:51.426185Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Perception-aware policy optimization for multimodal reasoning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:59ac5d8a75a726e9036b715caa9cf1bb23b369f9af20c29deab4104ac9f39208","observation_id":"8450f34c-dcd4-4cb8-9822-91253341aaaa","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Visual-rft: Visual reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:a7b076b40bfc4d5956c64c0a35d1a22e93cf9c9770592755ae599a3e6696f431","observation_id":"45733f55-72e0-47bb-ab4a-99f6fde0ffef","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Vl- rethinker: Incentivizing self-reflection of vision-language models with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:c67211f059ccd8501df7a014fe2af05db438a966edd4c13fd0312b4e839fc621","observation_id":"6d4eae79-72e5-409c-817b-5be5c45443ab","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.05175","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T17:40:00.895344Z","title":"Videoauto-r1: Video auto reasoning via thinking once, answering twice","venue":null,"work_id":"7a8e518d-2afc-49ca-8179-ecf520aa1753","year":2026},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:c3ac334d700d5e8316ee576d5c86a07a59a1eb385719af9d48318220adfa2daa","observation_id":"7fc44035-1d43-4e86-bb2d-0bd7171b9d00","resolution":{"observed_at":"2026-06-29T18:23:51.431143Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Emotion-llama: Multimodal emotion recognition and reasoning with instruction tuning.NeurIPS, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:19d6a59c03827adf5d60025fc5142d4e88c16bb3a2ffc6c85038044fb6f2854a","observation_id":"264cb53c-4288-43a0-8527-c53326148bf7","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Benchmarking and bridging emotion conflicts for multimodal emotion reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:8d08e94294184cab6a6ad74dee9667591ab911689fe53732b0598dc7b4a51ff8","observation_id":"d053f9a6-071c-4820-9585-8a194434da9f","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Mme-emotion: A holistic evaluation benchmark for emotional intelligence in multimodal large language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:559fb616441665b994f51efc3968af6c5883bf23140a207bfc8c096524d27fda","observation_id":"8e546f26-7de7-4ed5-9f63-2ad9a93e99a2","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05379","last_updated":"2025-03-10T07:11:14Z","snapshot_observed_at":"2026-07-06T20:48:31.837669Z","submitted_at":"2025-03-07T12:46:42Z","title":"R1-Omni: Explainable Omni-Multimodal Emotion Recognition with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.05379","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.05379","snapshot_observed_at":"2026-07-04T19:20:06.377429Z","title":"R1-omni: Explainable omni-multimodal emotion recognition with reinforcement learning","venue":null,"work_id":"bf1e132b-9fd3-4be1-9466-fc699b85e71a","year":2025},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"cited_paper":"/paper/2503.05379","citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:d8b56184612dcba1ae8eb8dda6297bb8dcc285469a607f4b0640e80bc92ff815","observation_id":"086d81b5-2dc0-4052-961a-924a3405b370","resolution":{"observed_at":"2026-06-29T18:23:51.423928Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Emotion-coherent reasoning for multimodal llms via emotional rationale verifier","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:70fcb4f917fddefb5ba8b32d4029ea765ce6a87126c206d2b9ac285756d0bbca","observation_id":"4b282b2f-c161-458b-9b76-c56c0e4435a5","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:cfe43133b3ef12d1edb1147c20aaf6bf7b737da30516e1464d299d47d9a2934e","observation_id":"83072bef-a268-4225-a828-3e1b98b061ed","resolution":{"observed_at":"2026-06-29T18:23:51.453211Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Salmonn: Towards generic hearing abilities for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:d1830e9dc338382bb456a96a9a76a0d2980381dc33bbdd503044c5caa3aa94aa","observation_id":"0122020a-d026-48ab-8b21-2d79d000c8dc","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:d3964dd1752e346197c2fe8ab9a3560f7b9aea52d367d45fc4f0283dc8f91916","observation_id":"859053f4-2207-4caf-baf0-528cce73949f","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:98b22e7899ef0e2ab18246cb4405b00c476977cefafe8f9eae9a392f8b6300bd","observation_id":"127d14ed-162b-4aa9-bb15-0ca07bac231c","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Chat-univi: Unified visual representation empowers large language models with image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:cc43edc35138ebc4a989fb1ea24572937a6bcf973d42505c2f9d491173244856","observation_id":"e11dc62f-2d2c-4f7e-b8dc-94eec586f0f6","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":"2304.14178","doi":"10.48550/arxiv.2304.14178","metadata_source":"pith","pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","venue":"cs.CL","work_id":"74a7deb6-48be-4132-9d35-882cc5870ebd","year":2023},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:a160090e911514d696b5bb78d3e2ec3f8cb8a759f1bf4fd8ef7075ba2d089c4d","observation_id":"143b3b6d-b76f-414e-84ef-d5e764626aae","resolution":{"observed_at":"2026-06-29T18:23:51.443168Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Pandagpt: One model to instruction-follow them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:d8dbdf4fb04c278feb8f683e1379a60258b769f4c20f3529367d77a4d95b1ce8","observation_id":"2e5ccf09-1a84-4ab5-b844-cb47b6bbecfc","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Mosi: multimodal corpus of sentiment intensity and subjectivity analysis in online opinion videos","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:489c35fd86f93b783ac1a7b696684a39a9cb0d4eadf138b7221e2cf72266ec9d","observation_id":"b38c01f2-033a-483f-9cdf-c17841a2db29","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Multimodal language analysis in the wild: Cmu-mosei dataset and interpretable dynamic fusion graph","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:f611cf2d9bc59844399e2632888de45518370a9c5f4b1264edd3143e6b777ce2","observation_id":"f93caa1b-a62c-4188-9bcf-52416996f7c9","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Ch-sims: A chinese multimodal sentiment analysis dataset with fine-grained annotation of modality","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:330f15eb2cba6af961dfe96415e3ea2db20cc24b244fa3bfa767b6b3a3cbbc77","observation_id":"01e3eb2d-5342-4afd-b2c0-e78bc5e9ccd6","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Make acoustic and visual cues matter: Ch-sims v2","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:ba7a55200e5bff396489fedc34fb40d6275dd6f8d80fbe7e95cee90d1808c30f","observation_id":"80d024b5-3ef5-4372-9754-565d282e052a","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Unsupervised visual chain-of-thought reasoning via preference optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:8db2d0b0a08df600381ce9f23ac5ed7e99881b5ae9883a367ef6d643c7daf8a8","observation_id":"ee359edf-d1b4-4b92-be34-6913f13c6e36","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"I’ll tell you, it’s not easy for a woman who has divorced and is raising a child to find a partner","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:511c90864462a7004adad4c03a5f6ab31aa994963c366d7c3bcff48643b08ec5","observation_id":"f91d2f90-53d9-4785-8c3c-dfd0ee759886","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":13,"verified_fuzzy":0},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 2 inbound Pith citation observations for arXiv:2606.27652."}