{"as_of":"2026-08-07T17:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bc0d7dcfb32ca4043ca6293711919cd36f55711098e36e123fcc423c4c7205b0","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T20:14:04.208238Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T20:58:30.855338Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T00:49:18.237054Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2602.23802","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.23802","snapshot_observed_at":"2026-07-09T02:19:51.159867Z","title":null,"venue":null,"work_id":"e324457f-f5ea-41e7-9719-16b53380f33a","year":2026},"citing_paper":{"arxiv_id":"2604.23348","last_updated":"2026-04-25T15:10:25Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T15:10:25Z","title":"EmoTrans: A Benchmark for Understanding, Reasoning, and Predicting Emotion Transitions in Multimodal LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-08T08:34:14.297331Z"},"links":{"cited_paper":"/paper/2602.23802","citing_paper":"/paper/2604.23348"},"observation_digest":"sha256:1dd8e42a59fffad4b658a132ad045d65d19f6964398125e2593516448718028f","observation_id":"fa78e801-308f-4fc0-9c07-e87da5f93f55","resolution":{"observed_at":"2026-07-09T02:19:51.159867Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2602.23802","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.23802","snapshot_observed_at":"2026-07-09T02:19:51.159867Z","title":null,"venue":null,"work_id":"e324457f-f5ea-41e7-9719-16b53380f33a","year":2026},"citing_paper":{"arxiv_id":"2606.18988","last_updated":"2026-06-17T12:08:20Z","snapshot_observed_at":"2026-08-06T08:59:20.055779Z","submitted_at":"2026-06-17T12:08:20Z","title":"ThinkDeception: A Progressive Reinforcement Learning Framework for Interpretable Multimodal Deception Detection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T20:58:30.855338Z"},"links":{"cited_paper":"/paper/2602.23802","citing_paper":"/paper/2606.18988"},"observation_digest":"sha256:211ea409892af517aaeda570280be323c62d283b4dd6cb474e0b4118e41d6607","observation_id":"69fc91f4-6db2-471b-96ed-195c024bd24c","resolution":{"observed_at":"2026-07-09T02:19:51.159867Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2602.23802/citation-record","integrity":"/paper/2602.23802/integrity","json":"/paper/2602.23802/citation-record.json","paper":"/paper/2602.23802"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-02T20:14:03.926761Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:03.926761Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:f0b4c463bb3ec849bb805b482c70118307d43ffb7114f80052a7264fffc99fe5","observation_id":"4cd56d96-2b52-4103-a29d-74bb6f807d40","resolution":{"observed_at":"2026-08-02T20:14:03.926761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:14:03.931853Z","title":"Chat-based person retrieval via dialogue-refined cross- modal alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:03.931853Z"},"links":{"citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:16a42a6f72b84a68d57711cffeb82f55e82a4e30dae0747d149ee8dc47f1612c","observation_id":"3e6a2209-868a-4065-a677-5949b44dea94","resolution":{"observed_at":"2026-08-02T20:14:03.931853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12359","last_updated":"2025-01-07T15:36:54Z","snapshot_observed_at":"2026-07-06T20:08:12.033767Z","submitted_at":"2024-12-16T21:14:11Z","title":"LLaVA Steering: Visual Instruction Tuning with 500x Fewer Parameters through Modality Linear Representation-Steering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12359","snapshot_observed_at":"2026-08-02T20:14:03.936058Z","title":"Visual instruction tuning with 500x fewer parameters through modality linear representation-steering.arXiv preprint arXiv:2412.12359,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:03.936058Z"},"links":{"cited_paper":"/paper/2412.12359","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:9334b499c7a5093aaeea070e6d9c6fc5b2a425bbe10743789981439d596d7859","observation_id":"f5f82134-7950-47e0-b50e-59a4701f04db","resolution":{"observed_at":"2026-08-02T20:14:03.936058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-07T15:43:41.219115Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-08-02T20:14:03.940645Z","title":"Seed-grpo: Semantic entropy enhanced grpo for uncertainty-aware policy optimization.arXiv preprint arXiv:2505.12346, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:03.940645Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:42a39249652f4204d266b6de89c13ababdafec0e6c2371befdde2bb6eb53e70c","observation_id":"4b031acc-1e60-4a7e-9592-a5d988094944","resolution":{"observed_at":"2026-08-02T20:14:03.940645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:14:03.944872Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:03.944872Z"},"links":{"citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:f058f702918790f6208aa208e7aa72ccc57e3e18c1ced61ec90de8592688a804","observation_id":"b75a2b15-288a-46cc-bfc9-084c113ae010","resolution":{"observed_at":"2026-08-02T20:14:03.944872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:14:03.948806Z","title":"Emotion-llama: Multimodal emo- tion recognition and reasoning with instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:03.948806Z"},"links":{"citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:6774a4c3079462795fb919bd095e8783a8ab05a0a800ad0b1fe696c2b3f955e9","observation_id":"867c155f-91dd-45cd-84de-92652adef16f","resolution":{"observed_at":"2026-08-02T20:14:03.948806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:14:03.953378Z","title":"Emoe: Modality-specific enhanced dynamic emotion experts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:03.953378Z"},"links":{"citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:6827b07a67f0b62c94aad06e6608102e15988db87d71093c84df6573c4223e56","observation_id":"2c596fe0-263a-40e7-ae4c-fc5c78ff0345","resolution":{"observed_at":"2026-08-02T20:14:03.953378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:14:03.957598Z","title":"Catch your emotion: Sharpening emotion perception in multimodal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:03.957598Z"},"links":{"citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:1513aad5e56386330b9f79438d750768d0bf1fa29ab8e5c72c935ec4953e65cf","observation_id":"e3a43277-9b65-48cc-8d6c-d0ace6ab562c","resolution":{"observed_at":"2026-08-02T20:14:03.957598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-02T20:14:03.962128Z","title":"Video-r1: Reinforcing video reasoning in mllms.arXiv preprint arXiv:2503.21776,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:03.962128Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:7a2f43190e39ab8019ac0ab4e5f8b01036755e0020a9444d581cfd6462355a2b","observation_id":"69e9830d-e0f9-489f-9055-05e1339ef576","resolution":{"observed_at":"2026-08-02T20:14:03.962128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15115","last_updated":"2024-11-27T11:58:50Z","snapshot_observed_at":"2026-07-06T19:36:27.984192Z","submitted_at":"2024-10-19T13:53:50Z","title":"On Designing Effective RL Reward at Training Time for LLM Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15115","snapshot_observed_at":"2026-08-02T20:14:03.966604Z","title":"On de- signing effective rl reward at training time for llm reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:03.966604Z"},"links":{"cited_paper":"/paper/2410.15115","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:c083da7911c99cce43aaf9dbd70cae47a1505ef707e5e9dc749e49ae99951259","observation_id":"4c969bbd-7ccb-46ba-894c-6d7ce7317ced","resolution":{"observed_at":"2026-08-02T20:14:03.966604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:14:03.970645Z","title":"Making the V in VQA matter: Ele- vating the role of image understanding in Visual Question Answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:03.970645Z"},"links":{"citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:10f6ad6908aa570722c44d40e71f3a3af47af1e559117aa78031c73eb07993da","observation_id":"169d64ab-9bc3-4aaa-a3d1-e31d2e091adb","resolution":{"observed_at":"2026-08-02T20:14:03.970645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-02T20:14:03.975221Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:03.975221Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:abe25257ecd36b85513df14c3fde34b578412240909dae5200f1cc70d3a2a419","observation_id":"0e5c2c49-9e68-49f4-821b-c86b13211d03","resolution":{"observed_at":"2026-08-02T20:14:03.975221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:14:03.979604Z","title":"Onellm: One framework to align all modalities with language","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:03.979604Z"},"links":{"citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:07d274c52e604952ec188c712b0e29d355df6713bb795189a48b9c0c5125b3f6","observation_id":"c884e79d-b998-4036-9c26-39a9e3a79689","resolution":{"observed_at":"2026-08-02T20:14:03.979604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23905","last_updated":"2025-06-27T14:37:02Z","snapshot_observed_at":"2026-08-07T16:25:36.572641Z","submitted_at":"2025-03-31T09:54:55Z","title":"Boosting MLLM Reasoning with Text-Debiased Hint-GRPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23905","snapshot_observed_at":"2026-08-02T20:14:03.983641Z","title":"Boosting mllm reasoning with text-debiased hint- grpo.arXiv preprint arXiv:2503.23905, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:03.983641Z"},"links":{"cited_paper":"/paper/2503.23905","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:5949f60828342bd386143b9ed3a36ccd302d935e8bb1def3238f7e6b07a412fc","observation_id":"88669c8e-ff9e-460f-a9bc-475363cf071b","resolution":{"observed_at":"2026-08-02T20:14:03.983641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04543","last_updated":"2025-03-06T15:29:13Z","snapshot_observed_at":"2026-08-07T17:24:25.171017Z","submitted_at":"2025-03-06T15:29:13Z","title":"Keeping Yourself is Important in Downstream Tuning Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04543","snapshot_observed_at":"2026-08-02T20:14:03.988119Z","title":"Keeping yourself is important in downstream tuning multimodal large language model.arXiv preprint arXiv:2503.04543, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:03.988119Z"},"links":{"cited_paper":"/paper/2503.04543","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:3bbf5007fc62b33bed9659e123d590ba705756fedb571fb613cf05f7c506fbfb","observation_id":"09b70d92-c221-4c5d-bb18-351c279dd5fc","resolution":{"observed_at":"2026-08-02T20:14:03.988119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:14:03.992089Z","title":"Learn from downstream and be yourself in multimodal large language model fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:03.992089Z"},"links":{"citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:7b01d9035208dc4e7add8f8d77eb173e463cb4f584cc999482e38ff5ddad045a","observation_id":"166182ab-f88f-4a23-94be-1b58b69e413f","resolution":{"observed_at":"2026-08-02T20:14:03.992089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:14:03.995576Z","title":"Be confident: Uncovering overfitting in mllm multi-task tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:03.995576Z"},"links":{"citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:42f41e06ae9551e36167ca111637a1991729952db5835d2da9710dc321e7075f","observation_id":"b49e719c-bbed-4059-8cbf-2654b980bcec","resolution":{"observed_at":"2026-08-02T20:14:03.995576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:14:04.000130Z","title":"Mapo: Mixed advantage policy optimization.arXiv preprint arXiv:2509.18849, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.000130Z"},"links":{"citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:b71e1e9d6bed169eda982ebfb59781bb09ecc50748a03a7f1a6d4673beb61dcf","observation_id":"f978c6f9-0930-4f9e-9c52-2fafc4da15a5","resolution":{"observed_at":"2026-08-02T20:14:04.000130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:14:04.004215Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.004215Z"},"links":{"citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:bafd9034dae7d4be8645450bcedf8de0a12e20deea93a4ad08c6a94270d32a22","observation_id":"8d0ee372-0197-4789-b5fd-33a3547311bf","resolution":{"observed_at":"2026-08-02T20:14:04.004215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:14:04.014431Z","title":"Learning from teaching reg- ularization: Generalizable correlations should be easy to im- itate.NeurIPS, 37:966–994, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.014431Z"},"links":{"citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:c5d8dc5ee935e08ea8377d235e56b0c745368a09e8290c814df1f5dc090b8a48","observation_id":"6ba12ad3-7345-43f1-b9d5-bf74065a11d0","resolution":{"observed_at":"2026-08-02T20:14:04.014431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09772","last_updated":"2025-08-19T01:06:10Z","snapshot_observed_at":"2026-08-07T16:06:04.783202Z","submitted_at":"2025-04-14T00:27:45Z","title":"Two Heads are Better Than One: Test-time Scaling of Multi-agent Collaborative Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09772","snapshot_observed_at":"2026-08-02T20:14:04.018075Z","title":"Two heads are better than one: Test- time scaling of multi-agent collaborative reasoning.arXiv preprint arXiv:2504.09772, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.018075Z"},"links":{"cited_paper":"/paper/2504.09772","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:0170258abedf2518e65fbc7ad9cf2721b2771dd8531a11bfaca2a77ae7430b74","observation_id":"b643d058-c196-4ab9-8cf6-775d461e7f7e","resolution":{"observed_at":"2026-08-02T20:14:04.018075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-02T20:14:04.022097Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.022097Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:e73238d060e5978a94a2d934d4dac161b5114cf8f56e0d7711f9638a4e632e8d","observation_id":"4f545ca4-f4e5-46f0-8ab6-9fc7b8480e2a","resolution":{"observed_at":"2026-08-02T20:14:04.022097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-02T20:14:04.026500Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforcement fine-tuning.arXiv preprint arXiv:2504.06958, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.026500Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:ddbae7d51ac3246c50802e39629cb999818f3266525691eee47099327f2abcd0","observation_id":"e9ed3b7d-bb1c-48e3-8590-3c8bb8682315","resolution":{"observed_at":"2026-08-02T20:14:04.026500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:14:04.031632Z","title":"Mon- key: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.031632Z"},"links":{"citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:89bb59c6c635e72a645b35a8431895b0d21ff178380d79f3eff49d7307a6d683","observation_id":"52a03b49-545a-4add-8801-f2ef62ba0e70","resolution":{"observed_at":"2026-08-02T20:14:04.031632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15401","last_updated":"2024-05-23T11:42:08Z","snapshot_observed_at":"2026-07-06T15:47:15.230195Z","submitted_at":"2023-06-27T11:54:57Z","title":"Explainable Multimodal Emotion Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15401","snapshot_observed_at":"2026-08-02T20:14:04.035428Z","title":"Explainable multimodal emotion recognition.arXiv preprint arXiv:2306.15401, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.035428Z"},"links":{"cited_paper":"/paper/2306.15401","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:3ad8fa4a3b825163bcdce7c85f089732f746d49569780ea4134e52878a4b9531","observation_id":"59cc902c-ffc9-4312-b13e-d044579918a7","resolution":{"observed_at":"2026-08-02T20:14:04.035428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:14:04.040180Z","title":"Ex- plainable multimodal emotion reasoning.CoRR, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.040180Z"},"links":{"citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:c550ba8984c11b5baa3c1c6bd03ffcba4027945feaa90ea91172f6d7eee78f71","observation_id":"6259af68-65e9-4987-87fb-aeb8c558bf51","resolution":{"observed_at":"2026-08-02T20:14:04.040180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16566","last_updated":"2025-05-07T13:20:08Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T23:18:39Z","title":"AffectGPT: A New Dataset, Model, and Benchmark for Emotion Understanding with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16566","snapshot_observed_at":"2026-08-02T20:14:04.044246Z","title":"Affectgpt: A new dataset, model, and benchmark for emotion understanding with multimodal large language models.arXiv preprint arXiv:2501.16566, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.044246Z"},"links":{"cited_paper":"/paper/2501.16566","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:6463f281b75c50ce36fe28c902ee46c3a5e574583e8d0452ff18c9984a3bf142","observation_id":"53e94391-8752-4c87-91f6-da012278d3c6","resolution":{"observed_at":"2026-08-02T20:14:04.044246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:14:04.049463Z","title":"Lorasculpt: Sculpting lora for harmonizing gen- eral and specialized knowledge in multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.049463Z"},"links":{"citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:c643427f3a0ece77ecc564d82f4230a57f23ec4c1e5754c3b567e5567e75ae50","observation_id":"27510ae0-731b-4a09-ba3b-d1d3fa7dfc4a","resolution":{"observed_at":"2026-08-02T20:14:04.049463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:14:04.053566Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.053566Z"},"links":{"citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:d8a7987c092ea967a58572dbefb5f565c7ebff5ec2b688b3dc6be7142161a8ee","observation_id":"5198f810-e98c-4f43-a03b-29e392bb71b6","resolution":{"observed_at":"2026-08-02T20:14:04.053566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:14:04.057327Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.057327Z"},"links":{"citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:4d6fc2678166f017bebdb03c92f6fa9e995ed9c814faa3d3ce714c7d9e5cf7b2","observation_id":"f2c09ffd-9984-4cc6-8f12-dffbfb00adc5","resolution":{"observed_at":"2026-08-02T20:14:04.057327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-04T16:07:24.699834Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.16679","snapshot_observed_at":"2026-08-02T20:14:04.060992Z","title":"Reinforcement learning meets large language models: A survey of advancements and applications across the llm lifecycle.arXiv preprint arXiv:2509.16679, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.060992Z"},"links":{"cited_paper":"/paper/2509.16679","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:035d19ab8dcc22fb16d8e0d53e1c12a7c67521382dee01b8e51cc355e37c72e8","observation_id":"0e13ce9d-1ac6-4f46-ba5e-ece760393791","resolution":{"observed_at":"2026-08-02T20:14:04.060992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09353","last_updated":"2024-07-09T05:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-14T17:59:34Z","title":"DoRA: Weight-Decomposed Low-Rank Adaptation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09353","snapshot_observed_at":"2026-08-02T20:14:04.064395Z","title":"Dora: Weight-decomposed low-rank adaptation.arXiv preprint arXiv:2402.09353, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.064395Z"},"links":{"cited_paper":"/paper/2402.09353","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:8232e20ca94d3b30b5bb2ff395200f8a33ef94dbbaad8afc34c6851384e08353","observation_id":"ca3dee2f-ea98-4697-b24c-e2cc7392bf62","resolution":{"observed_at":"2026-08-02T20:14:04.064395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11049","last_updated":"2025-05-16T09:46:10Z","snapshot_observed_at":"2026-08-07T15:44:47.554832Z","submitted_at":"2025-05-16T09:46:10Z","title":"GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11049","snapshot_observed_at":"2026-08-02T20:14:04.067928Z","title":"Guardreasoner-vl: Safeguarding vlms via reinforced reasoning.arXiv preprint arXiv:2505.11049,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.067928Z"},"links":{"cited_paper":"/paper/2505.11049","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:4b52f481af01109fbca1dbb856c630e2a2c4d72afe0acac4e309313039be9ac4","observation_id":"3d6b8d6d-4372-4639-b0c1-1623d1bf4361","resolution":{"observed_at":"2026-08-02T20:14:04.067928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-02T20:14:04.072542Z","title":"Visual- rft: Visual reinforcement fine-tuning.arXiv preprint arXiv:2503.01785, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.072542Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:073063abd55a5df71fbe18e5e5680241410e26476ba59e1893f3fb45e2178f88","observation_id":"962da5aa-3069-4019-b7c8-bbc4b4b49f14","resolution":{"observed_at":"2026-08-02T20:14:04.072542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:14:04.076915Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.076915Z"},"links":{"citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:f1eae4ae579abc21faec94083e0fe3e75dbd872423b60821a4cac78d78076fd6","observation_id":"99ecd203-8520-4069-aa2e-076ab866789e","resolution":{"observed_at":"2026-08-02T20:14:04.076915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:14:04.080359Z","title":"ChartQA: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.080359Z"},"links":{"citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:dd17a172607ff562d651ca4ec804d81d059c99b30b0175dbd89b8ef129b01c4b","observation_id":"92ee911f-cf4c-47d1-9d89-8c804cb215b8","resolution":{"observed_at":"2026-08-02T20:14:04.080359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:14:04.083661Z","title":"Con- templating visual emotions: Understanding and overcoming dataset bias","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.083661Z"},"links":{"citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:528ed87e637db8cd573792f5ca4ea14c99fa839195ea05f7511902872e21e0f0","observation_id":"aff71ea1-2ca9-4465-803d-97ee918da007","resolution":{"observed_at":"2026-08-02T20:14:04.083661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:14:04.087354Z","title":"A mixed bag of emotions: Model, predict, and transfer emotion distributions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.087354Z"},"links":{"citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:77aaf14a2d8b4c5e40fa6a68223be041eae2709d74ef9bade8d3b5e1cd188ef6","observation_id":"27520b90-5628-4f04-b25c-a61d3aa78a1f","resolution":{"observed_at":"2026-08-02T20:14:04.087354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:14:04.090762Z","title":"Direct preference optimization: Your language model is secretly a reward model.NeurIPS, 36:53728–53741, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.090762Z"},"links":{"citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:529ed9eae261ba729aea863eb232fe7d3df5da728672cdc0a105e0c1acc28968","observation_id":"0bf45be1-2d87-43d4-819e-b047bcce5e4d","resolution":{"observed_at":"2026-08-02T20:14:04.090762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.10616","last_updated":"2025-07-25T11:09:53Z","snapshot_observed_at":"2026-08-06T17:46:01.198994Z","submitted_at":"2025-07-13T19:04:17Z","title":"Scalpel vs. Hammer: GRPO Amplifies Existing Capabilities, SFT Replaces Them","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.10616","snapshot_observed_at":"2026-08-02T20:14:04.093885Z","title":"Scalpel vs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.093885Z"},"links":{"cited_paper":"/paper/2507.10616","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:ad2f1fd1197a9f47340ca4e9dedf51886769a3fa63ae4ba97ccfa17d38c5303b","observation_id":"6a028c1d-a1f0-43e3-8bb6-79290508172e","resolution":{"observed_at":"2026-08-02T20:14:04.093885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:14:04.097359Z","title":"Group robust preference optimization in reward- free rlhf","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.097359Z"},"links":{"citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:aeb780ec003da45739a44fff5ecde7ac7c7438683af4f2592f54b1f1276c3f4c","observation_id":"4728e5c8-49e0-4840-8f3d-9bea881b4156","resolution":{"observed_at":"2026-08-02T20:14:04.097359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","snapshot_observed_at":"2026-08-07T11:26:06.598387Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02211","snapshot_observed_at":"2026-08-02T20:14:04.101113Z","title":"Improving llm-generated code quality with grpo.arXiv preprint arXiv:2506.02211, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.101113Z"},"links":{"cited_paper":"/paper/2506.02211","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:a309d8ad71efdd1d449944c9c806110eab87a5ac81c3fd3f2523d78b6d5e7c60","observation_id":"c4a76982-bab2-4716-b3a1-911f1a06ad74","resolution":{"observed_at":"2026-08-02T20:14:04.101113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16916","last_updated":"2025-05-22T17:11:58Z","snapshot_observed_at":"2026-08-07T14:50:38.686307Z","submitted_at":"2025-05-22T17:11:58Z","title":"Backdoor Cleaning without External Guidance in MLLM Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16916","snapshot_observed_at":"2026-08-02T20:14:04.105502Z","title":"Backdoor clean- ing without external guidance in mllm fine-tuning.arXiv preprint arXiv:2505.16916, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.105502Z"},"links":{"cited_paper":"/paper/2505.16916","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:1d6e4f4a66ceb60ba702b92647a399d34bc91c82e0bbe59846616e4e38bd5eb6","observation_id":"c032eb3f-1a85-4ae7-80d9-82f2ad050429","resolution":{"observed_at":"2026-08-02T20:14:04.105502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:14:04.109291Z","title":"Safegrpo: Self-rewarded mul- timodal safety alignment via rule-governed policy optimiza- tion.arXiv preprint arXiv:2511.12982, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.109291Z"},"links":{"citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:770b584865be3df31d46c90dcc08755f3d4e96f0fe70fd5ae418c60446b74857","observation_id":"46c5102c-3f2c-401e-89c3-e8042cc4199c","resolution":{"observed_at":"2026-08-02T20:14:04.109291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-02T20:14:04.113356Z","title":"Proximal policy optimization algo- rithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.113356Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:81fa11ddcbdb2ab1645f59cc8ba6829191a07bd999c3410df24d5bf0feb58aab","observation_id":"69886bcf-14df-4f05-8660-906311129984","resolution":{"observed_at":"2026-08-02T20:14:04.113356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-02T20:14:04.117269Z","title":"Deepseekmath: Pushing the limits of math- ematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.117269Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:bc1d86d92b8c212d301f75e27daa532e6d5d35433c1f65cdc0f960da28aef18d","observation_id":"1e57f08a-bbc3-4180-9778-995074537ebb","resolution":{"observed_at":"2026-08-02T20:14:04.117269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:14:04.120825Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.120825Z"},"links":{"citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:22fadead39525d7270b976fab2bc0c515fff0f3a39a229742275c5f4ea564b0f","observation_id":"ecce399c-cda8-4b52-b950-650d78ca25d5","resolution":{"observed_at":"2026-08-02T20:14:04.120825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T14:49:20.251890Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17017","snapshot_observed_at":"2026-08-02T20:14:04.125091Z","title":"Delving into rl for image generation with cot: A study on dpo vs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.125091Z"},"links":{"cited_paper":"/paper/2505.17017","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:666384320062d8ae4812d66bad455585bff99db105ffbec2b575db6ad715d2d0","observation_id":"f372d45e-5e7b-40e5-94aa-87ed35887192","resolution":{"observed_at":"2026-08-02T20:14:04.125091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-02T20:14:04.128711Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.128711Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:3f8dc24885878ddf4a96984801da3cc572dfccb2b52bb6cab105ab956cc6f150","observation_id":"7a3c0ec5-ac01-4374-90f1-de67f8959d2e","resolution":{"observed_at":"2026-08-02T20:14:04.128711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17704","last_updated":"2025-05-24T12:50:56Z","snapshot_observed_at":"2026-08-07T15:59:26.458348Z","submitted_at":"2025-04-24T16:11:01Z","title":"Safety in Large Reasoning Models: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17704","snapshot_observed_at":"2026-08-02T20:14:04.132863Z","title":"Safety in large reasoning models: A survey.arXiv preprint arXiv:2504.17704, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.132863Z"},"links":{"cited_paper":"/paper/2504.17704","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:8c3691acc297195bb3651763ca8e9a2e77ee5d519afa245993ba97040eb8bf59","observation_id":"522417f4-1a78-4044-a568-0fd3d45fca66","resolution":{"observed_at":"2026-08-02T20:14:04.132863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-02T20:14:04.136705Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.136705Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:5433952e355de1c68db179e76778c322d13db58f69ac2f068f862c3a5d0a61ed","observation_id":"22e2dcba-707d-4f81-b689-e8ad3995e6b8","resolution":{"observed_at":"2026-08-02T20:14:04.136705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:14:04.140872Z","title":"Chain-of-thought prompting elicits reasoning in large lan- guage models.NeurIPS, 35:24824–24837, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.140872Z"},"links":{"citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:55920aac07301a162412a5cd1167e2dc677da877552e1ff41013aa7770c26cd6","observation_id":"59060050-f419-4957-89b1-643d4c823cba","resolution":{"observed_at":"2026-08-02T20:14:04.140872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:14:04.144878Z","title":"Emovit: Revolutionizing emotion insights with vi- sual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.144878Z"},"links":{"citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:a425adf45d4578a37a87e324b229ef2a70a26c32ff1ee01e46ef7344ae07b753","observation_id":"c1e93403-6ca3-4643-ac57-c4e73cf20b0e","resolution":{"observed_at":"2026-08-02T20:14:04.144878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11424","last_updated":"2024-08-21T08:28:40Z","snapshot_observed_at":"2026-08-06T05:36:36.831165Z","submitted_at":"2024-08-21T08:28:40Z","title":"EMO-LLaMA: Enhancing Facial Emotion Understanding with Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11424","snapshot_observed_at":"2026-08-02T20:14:04.148188Z","title":"Emo-llama: Enhancing facial emo- tion understanding with instruction tuning.arXiv preprint arXiv:2408.11424, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.148188Z"},"links":{"cited_paper":"/paper/2408.11424","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:c43ba300bcd6206c65b0c203aa95d831f272beada74c85cfa6a50ddaa18d874b","observation_id":"87fc2543-5052-495c-859b-030fe9d8634d","resolution":{"observed_at":"2026-08-02T20:14:04.148188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10719","last_updated":"2024-10-10T08:30:17Z","snapshot_observed_at":"2026-07-06T18:01:05.698046Z","submitted_at":"2024-04-16T16:51:53Z","title":"Is DPO Superior to PPO for LLM Alignment? A Comprehensive Study","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10719","snapshot_observed_at":"2026-08-02T20:14:04.152731Z","title":"Is dpo superior to ppo for llm alignment? a comprehensive study","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.152731Z"},"links":{"cited_paper":"/paper/2404.10719","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:4a3be49d8520826d6533810bae4e31730ec3052d52093eec5317cb68e7e3d093","observation_id":"3df01c42-bc3c-42a3-bcce-7636b9fec44e","resolution":{"observed_at":"2026-08-02T20:14:04.152731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:14:04.156268Z","title":"Context de-confounded emo- tion recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.156268Z"},"links":{"citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:890196ee52306d258fe3f330b86c7a814d8b9112bc30dad55f048922d4ca2252","observation_id":"692916be-1ac3-489f-a15d-be3cdbf6720c","resolution":{"observed_at":"2026-08-02T20:14:04.156268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:14:04.160499Z","title":"Emoset: A large-scale visual emotion dataset with rich attributes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.160499Z"},"links":{"citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:7be5f2e10878d819cc8eca17c03cac1af8218629ba6b79290fdc47fa9cd536fc","observation_id":"af7a6d69-2908-4c83-93d8-f171cf81bf40","resolution":{"observed_at":"2026-08-02T20:14:04.160499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16442","last_updated":"2024-06-29T14:32:46Z","snapshot_observed_at":"2026-07-06T18:35:54.300599Z","submitted_at":"2024-06-24T08:33:02Z","title":"EmoLLM: Multimodal Emotional Understanding Meets Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16442","snapshot_observed_at":"2026-08-02T20:14:04.163905Z","title":"Emollm: Multimodal emo- tional understanding meets large language models.arXiv preprint arXiv:2406.16442, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.163905Z"},"links":{"cited_paper":"/paper/2406.16442","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:ee07c852b2f74916da3c61eccc0aa057e875fc7c5a1768c5e03ab424cc5781ae","observation_id":"f35fdd9d-b03b-4a5d-aa92-085b7533807b","resolution":{"observed_at":"2026-08-02T20:14:04.163905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:14:04.167966Z","title":"Treerpo: Tree relative policy optimization.arXiv preprint arXiv:2506.05183, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.167966Z"},"links":{"citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:f573a82b627a198eb4f5b8cf73025a2878f0cda6a5477784851c60c7980933fd","observation_id":"556aad84-e02d-4eb8-89cc-e5b46b98d3bf","resolution":{"observed_at":"2026-08-02T20:14:04.167966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16673","last_updated":"2025-05-22T13:39:32Z","snapshot_observed_at":"2026-08-07T14:55:04.641472Z","submitted_at":"2025-05-22T13:39:32Z","title":"R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16673","snapshot_observed_at":"2026-08-02T20:14:04.172212Z","title":"R1-sharevl: Incentivizing reasoning capability of multimodal large language models via share-grpo.arXiv preprint arXiv:2505.16673, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.172212Z"},"links":{"cited_paper":"/paper/2505.16673","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:975b2ae9dea57b401b880488f002c28302e1dcc1408195fbad9b0c0a9dcf4ed7","observation_id":"8f57803f-09a7-4de7-acb0-196233095552","resolution":{"observed_at":"2026-08-02T20:14:04.172212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14881","last_updated":"2025-02-14T08:42:43Z","snapshot_observed_at":"2026-08-07T07:39:27.021441Z","submitted_at":"2025-02-14T08:42:43Z","title":"A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14881","snapshot_observed_at":"2026-08-02T20:14:04.175590Z","title":"A survey of safety on large vision- language models: Attacks, defenses and evaluations.arXiv preprint arXiv:2502.14881, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.175590Z"},"links":{"cited_paper":"/paper/2502.14881","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:d9d03110ea194443bae72f5176749498cdf8d21341f4823f166b9c80cc41bb4f","observation_id":"62ccc93d-2d7e-438a-95c0-4eb85a2c60fa","resolution":{"observed_at":"2026-08-02T20:14:04.175590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:14:04.179183Z","title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descrip- tions.TACL, 2:67–78, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.179183Z"},"links":{"citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:5329c224cccc593ec0052a0de8ba0e28f7fd1f38d3b3bd87cf29ce49cb5178ae","observation_id":"3dcfe257-3936-4fa6-b59a-5fe1adcdfa63","resolution":{"observed_at":"2026-08-02T20:14:04.179183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-02T20:14:04.182502Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.182502Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:d57fa160f0912a666f4bc93171306a0c97f32b916f35658d50813eb760fac03d","observation_id":"6d08763c-cd4f-4ed1-8cd7-fb6ff35ccfcf","resolution":{"observed_at":"2026-08-02T20:14:04.182502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-06T21:34:54.534751Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-08-02T20:14:04.186690Z","title":"R1-vl: Learn- ing to reason with multimodal large language models via step-wise group relative policy optimization.arXiv preprint arXiv:2503.12937, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.186690Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:d9c52035570b9ef2e10ac9314a9a7f7801536c00182e65682484a8711eecc9f1","observation_id":"cbd7b248-e55a-4389-b6b7-990c45a2056c","resolution":{"observed_at":"2026-08-02T20:14:04.186690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:14:04.190105Z","title":"Microemo: Time-sensitive multimodal emotion recognition with subtle clue dynamics in video dialogues","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.190105Z"},"links":{"citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:73366ae63bb60640f884316da0a3b3ead80f5d7460449e29d58e8aa30d1acc01","observation_id":"66cb5cf7-9f92-45a8-8ccb-796b1d8260de","resolution":{"observed_at":"2026-08-02T20:14:04.190105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16181","last_updated":"2024-02-25T20:07:13Z","snapshot_observed_at":"2026-08-04T14:27:16.874742Z","submitted_at":"2024-02-25T20:07:13Z","title":"How Can LLM Guide RL? A Value-Based Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16181","snapshot_observed_at":"2026-08-02T20:14:04.194029Z","title":"How can llm guide rl? a value-based approach","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.194029Z"},"links":{"cited_paper":"/paper/2402.16181","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:080b36ddddf366e2bd038ea8d706f5a1b1df2e557205e4131c8b0de0eb2bf2f7","observation_id":"8d8e9f2e-b3b5-446e-9ad1-4a64d29f34d9","resolution":{"observed_at":"2026-08-02T20:14:04.194029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:14:04.198029Z","title":"Facephi: Lightweight multimodal large language model for facial landmark emotion recogni- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.198029Z"},"links":{"citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:600c63c46deaa67ac724b3fd676ff5fdfd5cb25936e5325931f944e3758c925a","observation_id":"52018fda-f74d-4068-8447-68a61f8ef8f0","resolution":{"observed_at":"2026-08-02T20:14:04.198029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03507","last_updated":"2024-06-02T21:24:12Z","snapshot_observed_at":"2026-07-06T17:40:15.746482Z","submitted_at":"2024-03-06T07:29:57Z","title":"GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03507","snapshot_observed_at":"2026-08-02T20:14:04.201189Z","title":"Galore: Memory- efficient llm training by gradient low-rank projection.arXiv preprint arXiv:2403.03507, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.201189Z"},"links":{"cited_paper":"/paper/2403.03507","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:5d9e44a64c776ddeb68b586e57af562cee30e91cb87e4d30f1c06802f74b2d76","observation_id":"76d0ea6c-b4c6-4acf-a1aa-53d26834d7d3","resolution":{"observed_at":"2026-08-02T20:14:04.201189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05379","last_updated":"2025-03-10T07:11:14Z","snapshot_observed_at":"2026-08-07T17:22:15.100571Z","submitted_at":"2025-03-07T12:46:42Z","title":"R1-Omni: Explainable Omni-Multimodal Emotion Recognition with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05379","snapshot_observed_at":"2026-08-02T20:14:04.204686Z","title":"R1-omni: Ex- plainable omni-multimodal emotion recognition with rein- forcement learning.arXiv preprint arXiv:2503.05379, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.204686Z"},"links":{"cited_paper":"/paper/2503.05379","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:4629427383bfc494e37f44f5e05964916c829eeb32358b5ecdb22e3e89fbc305","observation_id":"da0ed51d-46e0-4298-a61d-1cb6ba46f34e","resolution":{"observed_at":"2026-08-02T20:14:04.204686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21277","last_updated":"2025-05-21T06:08:31Z","snapshot_observed_at":"2026-08-07T15:57:57.813561Z","submitted_at":"2025-04-30T03:14:28Z","title":"Reinforced MLLM: A Survey on RL-Based Reasoning in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21277","snapshot_observed_at":"2026-08-02T20:14:04.208238Z","title":"Reinforced mllm: A survey on rl-based reasoning in multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.208238Z"},"links":{"cited_paper":"/paper/2504.21277","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:00cee988a194c40ce62e95fb5ecdfacd990b0e81315ba66eaf646bddca119229","observation_id":"2c6fc92a-3f10-48c5-9a5d-e03dc2aaa7f9","resolution":{"observed_at":"2026-08-02T20:14:04.208238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":70,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 2 inbound Pith citation observations for arXiv:2602.23802."}