{"as_of":"2026-08-20T22:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8a84f881b918ed42bff69ea68c1c07262c131d07d680783487815d35f21530fe","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T20:52:33.342830Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":32,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:46:40.558808Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-11T20:13:47.526714Z","title":"Mme-cot: Benchmarking chain-of-thought in large multimodal models for reasoning quality, robustness, and efficiency","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.05983","last_updated":"2025-07-26T14:45:01Z","snapshot_observed_at":"2026-08-14T09:40:33.773143Z","submitted_at":"2024-12-08T16:10:42Z","title":"Chimera: Improving Generalist Model with Domain-Specific Experts","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T20:13:47.526714Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2412.05983"},"observation_digest":"sha256:22599416031b1e4bb02b8f3bede2bdbc9be3bebf052a0953560f92d54c39ae17","observation_id":"b26f2c23-f8ac-4194-a8a7-e5bcb594f061","resolution":{"observed_at":"2026-08-11T20:13:47.526714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":"2502.09621","doi":"10.48550/arxiv.2502.09621","metadata_source":"pith","pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mme-cot: Benchmarking chain-of-thought in large multimodal models for reasoning quality, robustness, and efficiency","venue":"cs.CV","work_id":"7d62286a-e2c2-4a9d-b440-5f218c4ec409","year":2025},"citing_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"reference_index":178,"source":"pdf_text","source_observed_at":"2026-05-15T17:18:52.996467Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2503.12605"},"observation_digest":"sha256:6f94f52ad0acbfe28577f072e4ad621f7c15aab7b405cc2a57c7c29754957e03","observation_id":"1da6b807-10dd-4f9b-ad92-86135e062636","resolution":{"observed_at":"2026-05-15T17:18:53.307174Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-16T11:46:40.558808Z","title":"Mme-cot: Benchmarking chain-of-thought in large multimodal models for reasoning quality, robustness, and efficiency.arXiv preprint arXiv:2502.09621, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14693","last_updated":"2025-05-02T22:30:26Z","snapshot_observed_at":"2026-08-18T02:26:00.733954Z","submitted_at":"2025-04-20T17:58:46Z","title":"Video-MMLU: A Massive Multi-Discipline Lecture Understanding Benchmark","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-16T11:46:40.558808Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2504.14693"},"observation_digest":"sha256:441b8a64a0fb51d793463ac6ee861503e1a9e99e2ae464cb3114c1ba16b5584a","observation_id":"c05d8c33-2704-4454-b15a-81467a564cc8","resolution":{"observed_at":"2026-08-16T11:46:40.558808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-16T05:43:55.178439Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.19898","last_updated":"2025-04-28T15:30:58Z","snapshot_observed_at":"2026-08-17T08:05:28.071014Z","submitted_at":"2025-04-28T15:30:58Z","title":"GenCLS++: Pushing the Boundaries of Generative Classification in LLMs Through Comprehensive SFT and RL Studies Across Diverse Datasets","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T05:43:55.178439Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2504.19898"},"observation_digest":"sha256:df7f59dbf731a17461b599fcf587f9a7ca0f838c08133c22fcf705255ce0a01a","observation_id":"43395219-3aa2-4dea-8dbb-8e7c711bb315","resolution":{"observed_at":"2026-08-16T05:43:55.178439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-16T05:12:18.255202Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.21277","last_updated":"2025-05-21T06:08:31Z","snapshot_observed_at":"2026-08-20T10:56:49.638012Z","submitted_at":"2025-04-30T03:14:28Z","title":"Reinforced MLLM: A Survey on RL-Based Reasoning in Multimodal Large Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T05:12:18.255202Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2504.21277"},"observation_digest":"sha256:c80f09222b3d6024c982fa1bbe0cfdca21040902f327f998acfea24ca49192b8","observation_id":"7f638547-27f0-4112-b319-ff9b6036f745","resolution":{"observed_at":"2026-08-16T05:12:18.255202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-16T04:41:47.606617Z","title":"arXiv preprint arXiv:2502.09621 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.606617Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:18e2808015186de08d42ac8ba9fd46422c2e1b69d44e814bf08153942be538ab","observation_id":"d553872c-3bdc-45f3-84b6-02daa4b3731c","resolution":{"observed_at":"2026-08-16T04:41:47.606617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-07T15:02:25.409128Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16579","last_updated":"2025-05-22T12:14:23Z","snapshot_observed_at":"2026-08-20T18:57:29.533734Z","submitted_at":"2025-05-22T12:14:23Z","title":"Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T15:02:25.409128Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2505.16579"},"observation_digest":"sha256:e8ec668e3bdf2d1aa48fb04172c176244fd1c6f3cf16f346833db289deefe0bb","observation_id":"e7c8bc35-93ae-49e7-8dd3-60f36a5cfcb2","resolution":{"observed_at":"2026-08-07T15:02:25.409128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-07T14:31:20.174450Z","title":"Mme-cot: Benchmarking chain-of-thought in large multimodal models for reasoning quality, robustness, and efficiency","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-16T23:13:31.947741Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":133,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:20.174450Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:415c1c15eecf073f6243290153a983aba4a729df8720d79ae900a852c5e0ad60","observation_id":"64fa8169-87f8-49cf-93a9-1ef6df20847e","resolution":{"observed_at":"2026-08-07T14:31:20.174450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-07T13:35:57.991134Z","title":"Mme-cot: Benchmarking chain-of-thought in large multimodal models for reasoning quality, robustness, and efficiency, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21327","last_updated":"2025-05-27T15:23:23Z","snapshot_observed_at":"2026-08-20T06:11:48.391709Z","submitted_at":"2025-05-27T15:23:23Z","title":"MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:57.991134Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2505.21327"},"observation_digest":"sha256:d9dec377b06181551a21f7a8a9e27047c3846b669c63dda974251f3597f3d449","observation_id":"62227da7-50b8-4328-beae-82ff7276f698","resolution":{"observed_at":"2026-08-07T13:35:57.991134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-07T13:14:37.308207Z","title":"Mme-cot: Benchmarking chain-of-thought in large multimodal models for reasoning quality, robustness, and efficiency","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:37.308207Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:1d85c159c24dfad59470826f77679fed7b4a5c2035e3f30191aeb45a3bbe7abc","observation_id":"e13b0d27-6df3-4901-8c5d-bd1ed2145f42","resolution":{"observed_at":"2026-08-07T13:14:37.308207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-07T12:36:19.638964Z","title":"Mme-cot: Benchmarking chain-of-thought in large multimodal models for reasoning quality, robustness, and efficiency.arXiv preprint arXiv:2502.09621, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:19.638964Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:11e17551cf73fd708c0c8002e87f25de2bedeaab56c562903d14df559637e6ee","observation_id":"cd3064e3-fe71-4bab-b0a8-eada1baeb521","resolution":{"observed_at":"2026-08-07T12:36:19.638964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-07T12:33:08.379110Z","title":"Mme-cot: Benchmarking chain-of-thought in large multimodal models for reasoning quality, robustness, and efficiency.arXiv preprint arXiv:2502.09621, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24238","last_updated":"2025-06-02T04:16:04Z","snapshot_observed_at":"2026-08-17T05:22:52.210760Z","submitted_at":"2025-05-30T05:54:36Z","title":"MIRAGE: Assessing Hallucination in Multimodal Reasoning Chains of MLLM","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:08.379110Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2505.24238"},"observation_digest":"sha256:521b0dc69ddcfb88c2aa4e3cade026a84f47456ecaa89b612c763145fa830a48","observation_id":"a72d196d-62cc-4209-83be-37aec9055dc7","resolution":{"observed_at":"2026-08-07T12:33:08.379110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-07T12:22:11.542607Z","title":"Mme-cot: Benchmarking chain-of-thought in large multimodal models for reasoning quality, robustness, and efficiency,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24718","last_updated":"2025-06-08T14:43:47Z","snapshot_observed_at":"2026-08-18T02:01:36.218531Z","submitted_at":"2025-05-30T15:42:19Z","title":"Reinforcing Video Reasoning with Focused Thinking","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:11.542607Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2505.24718"},"observation_digest":"sha256:8f9e228432a83ffa09b4a15c9e018768817e2769ad828b0373567c6cb31ee5a2","observation_id":"9f385f3f-9ae7-46d2-8098-d70880665cf6","resolution":{"observed_at":"2026-08-07T12:22:11.542607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-07T11:05:19.357259Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-19T15:25:59.774604Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.357259Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:ba3772fe5b4b21f8dbcff994226c9af6fe0838b7224354464db3ecec60c4a409","observation_id":"110bcaec-d601-4d7f-807d-775cf6756cf5","resolution":{"observed_at":"2026-08-07T11:05:19.357259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-07T05:25:30.371674Z","title":"MME- CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency, February 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-20T05:07:58.272674Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.371674Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:4495659d43c919d83a09b51742a27d42658d8ad75db54e24ccfcf6c85d0cf308","observation_id":"cac6d4c7-64c9-4415-9f84-4ca332bb8d68","resolution":{"observed_at":"2026-08-07T05:25:30.371674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":"2502.09621","doi":"10.48550/arxiv.2502.09621","metadata_source":"pith","pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mme-cot: Benchmarking chain-of-thought in large multimodal models for reasoning quality, robustness, and efficiency","venue":"cs.CV","work_id":"7d62286a-e2c2-4a9d-b440-5f218c4ec409","year":2025},"citing_paper":{"arxiv_id":"2506.11991","last_updated":"2026-05-01T04:30:18Z","snapshot_observed_at":"2026-08-15T04:02:04.964450Z","submitted_at":"2025-06-13T17:47:43Z","title":"VGR: Visual Grounded Reasoning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-19T09:11:00.295700Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2506.11991"},"observation_digest":"sha256:bf346d3a95e7b5d49be048bdc0bb5b21e0b1d0a733e1de14e72942611d174bf6","observation_id":"28d5785d-4207-4f33-ae33-38be8ef5b07a","resolution":{"observed_at":"2026-05-19T09:12:14.480452Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-06T21:41:38.034436Z","title":"Mme-cot: Benchmarking chain-of-thought in large multimodal models for reasoning quality, robustness, and efficiency","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-20T11:17:49.263799Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:38.034436Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:88c8267a51324b2c55915c4c57b2d2d17b0f4c9b760ea5221c591955f2a3c2f5","observation_id":"6d2fc3ba-87a4-408e-b6d2-28629dc2b5da","resolution":{"observed_at":"2026-08-06T21:41:38.034436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-05T20:44:13.035019Z","title":"Mme-cot: Benchmarking chain-of-thought in large multimodal models for reasoning quality, robustness, and efficiency","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-19T18:52:45.346695Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:13.035019Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:3b9678c3c5153c1b1c91c6c2ce82357aeb735d4804e5d8195869f4d45ce68c38","observation_id":"537b8e27-1d48-45fe-9349-229f5710d9d2","resolution":{"observed_at":"2026-08-05T20:44:13.035019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":"2502.09621","doi":"10.48550/arxiv.2502.09621","metadata_source":"pith","pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mme-cot: Benchmarking chain-of-thought in large multimodal models for reasoning quality, robustness, and efficiency","venue":"cs.CV","work_id":"7d62286a-e2c2-4a9d-b440-5f218c4ec409","year":2025},"citing_paper":{"arxiv_id":"2510.21122","last_updated":"2026-04-07T14:13:33Z","snapshot_observed_at":"2026-08-12T16:09:53.216406Z","submitted_at":"2025-10-24T03:23:34Z","title":"NoisyGRPO: Incentivizing Multimodal CoT Reasoning via Noise Injection and Bayesian Estimation","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T04:39:58.296388Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2510.21122"},"observation_digest":"sha256:0372bf6e01e934620f8ffed21211e30d95639fed126cc1c8efb42f9552d5f0fb","observation_id":"6b305162-d8bf-4a8c-b1ec-785991a2c9be","resolution":{"observed_at":"2026-05-18T04:40:52.920863Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":"2502.09621","doi":"10.48550/arxiv.2502.09621","metadata_source":"pith","pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mme-cot: Benchmarking chain-of-thought in large multimodal models for reasoning quality, robustness, and efficiency","venue":"cs.CV","work_id":"7d62286a-e2c2-4a9d-b440-5f218c4ec409","year":2025},"citing_paper":{"arxiv_id":"2511.23253","last_updated":"2026-05-17T14:28:57Z","snapshot_observed_at":"2026-08-14T11:58:54.558459Z","submitted_at":"2025-11-28T15:02:19Z","title":"AgroCoT: A Chain-of-Thought Benchmark for Evaluating Reasoning in Vision-Language Models for Agriculture","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T17:59:42.921867Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2511.23253"},"observation_digest":"sha256:4ae0aa66b82d8a365e03c4093b3d2cc48cca7183a450eb6e52b57193c77f5b55","observation_id":"3aaa64e7-2f99-4fcc-81b0-00f248706cd0","resolution":{"observed_at":"2026-05-21T18:00:26.936626Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-03T12:31:13.837612Z","title":"Mme-cot: Benchmarking chain-of-thought in large multimodal models for reasoning quality, robustness, and efficiency.arXiv preprint arXiv:2502.09621, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.02918","last_updated":"2026-07-09T13:46:12Z","snapshot_observed_at":"2026-08-19T20:06:42.655292Z","submitted_at":"2026-01-06T11:00:17Z","title":"Zoom-IQA: Image Quality Assessment with Reliable Region-Aware Reasoning","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T12:31:13.837612Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2601.02918"},"observation_digest":"sha256:2fbda4b1adc3f5aef9ddb9dbac62f287be55de020e138326f43d4266e86bbb6d","observation_id":"56a1bbe8-72e1-4ff9-82a5-9707470a5fb8","resolution":{"observed_at":"2026-08-03T12:31:13.837612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":"2502.09621","doi":"10.48550/arxiv.2502.09621","metadata_source":"pith","pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mme-cot: Benchmarking chain-of-thought in large multimodal models for reasoning quality, robustness, and efficiency","venue":"cs.CV","work_id":"7d62286a-e2c2-4a9d-b440-5f218c4ec409","year":2025},"citing_paper":{"arxiv_id":"2601.06993","last_updated":"2026-04-10T19:45:13Z","snapshot_observed_at":"2026-08-14T17:07:02.674582Z","submitted_at":"2026-01-11T17:07:47Z","title":"Can Textual Reasoning Improve the Performance of MLLMs on Fine-grained Visual Classification?","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T14:51:26.368439Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2601.06993"},"observation_digest":"sha256:aa0ca809e3f54424a6698cb12f21c5fe6a18be940b99e9d647c7eda9cb9e3e8d","observation_id":"f622eb48-a493-4d6c-8d6d-0f1cb57d055e","resolution":{"observed_at":"2026-05-16T14:53:00.658187Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-03T10:49:58.895997Z","title":"Mme-cot: Benchmarking chain-of-thought in large multimodal models for reasoning quality, robustness, and efficiency.arXiv preprint arXiv:2502.09621, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.08758","last_updated":"2026-06-29T18:48:00Z","snapshot_observed_at":"2026-08-15T01:23:27.360746Z","submitted_at":"2026-01-13T17:42:27Z","title":"M3CoTBench: Benchmark Chain-of-Thought of MLLMs in Medical Image Understanding","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T10:49:58.895997Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2601.08758"},"observation_digest":"sha256:02e331febb29f5d81fa81d16a1eccafab8c14d083a48cd5f19dce38dc2467125","observation_id":"b7c62b84-fba3-43e2-9958-c5d17e716a56","resolution":{"observed_at":"2026-08-03T10:49:58.895997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-03T04:03:52.139078Z","title":"Mme-cot: Benchmarking chain-of-thought in large multimodal models for reasoning quality, robustness, and efficiency.arXiv preprint arXiv:2502.09621, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.07075","last_updated":"2026-07-23T07:39:02Z","snapshot_observed_at":"2026-08-14T03:28:45.123294Z","submitted_at":"2026-02-06T01:28:27Z","title":"LatentChem: From Textual CoT to Latent Thinking in Chemical Reasoning","version":6},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T04:03:52.139078Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2602.07075"},"observation_digest":"sha256:dd8146c79021dc577ec0e764788e4698628abc722b384781ba07a15609411d08","observation_id":"22de22f5-fc81-4bfc-863a-512eface1961","resolution":{"observed_at":"2026-08-03T04:03:52.139078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-02T23:26:30.170558Z","title":"Mme-cot: Benchmarking chain- of-thought in large multimodal models for reasoning quality, robustness, and efficiency.arXiv preprint arXiv:2502.09621,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.13904","last_updated":"2026-07-23T02:27:49Z","snapshot_observed_at":"2026-08-17T18:44:03.100895Z","submitted_at":"2026-02-14T21:53:47Z","title":"Diagnosing Pathological Chain-of-Thought in Reasoning Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T23:26:30.170558Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2602.13904"},"observation_digest":"sha256:b5d648275f08a98ec849fa4140ae38b53fc6f49b1d2abe13547f54ec598c6c20","observation_id":"67411b12-62ff-4ea4-aa44-03ef635dfc84","resolution":{"observed_at":"2026-08-02T23:26:30.170558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":"2502.09621","doi":"10.48550/arxiv.2502.09621","metadata_source":"pith","pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mme-cot: Benchmarking chain-of-thought in large multimodal models for reasoning quality, robustness, and efficiency","venue":"cs.CV","work_id":"7d62286a-e2c2-4a9d-b440-5f218c4ec409","year":2025},"citing_paper":{"arxiv_id":"2604.05015","last_updated":"2026-04-06T17:59:56Z","snapshot_observed_at":"2026-08-11T05:50:34.916262Z","submitted_at":"2026-04-06T17:59:56Z","title":"Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T18:47:32.778695Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2604.05015"},"observation_digest":"sha256:063e713653cbc818db0dc8b90b7e5047aaae265eed6d225602b03e7f59f6c922","observation_id":"30637812-e859-4696-a2b8-697ebc23ace7","resolution":{"observed_at":"2026-05-10T23:55:51.274219Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":"2502.09621","doi":"10.48550/arxiv.2502.09621","metadata_source":"pith","pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mme-cot: Benchmarking chain-of-thought in large multimodal models for reasoning quality, robustness, and efficiency","venue":"cs.CV","work_id":"7d62286a-e2c2-4a9d-b440-5f218c4ec409","year":2025},"citing_paper":{"arxiv_id":"2605.15198","last_updated":"2026-05-14T17:59:55Z","snapshot_observed_at":"2026-08-17T08:03:57.835181Z","submitted_at":"2026-05-14T17:59:55Z","title":"ATLAS: Agentic or Latent Visual Reasoning? One Word is Enough for Both","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T03:09:58.411261Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2605.15198"},"observation_digest":"sha256:a15c3c034a0b1bba5ef0a150dc458d366e5915771ab78a6addf060208f4bdaec","observation_id":"b2fe1677-9a24-4a1f-a230-d30daf5ec570","resolution":{"observed_at":"2026-05-15T03:14:53.506781Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":"2502.09621","doi":"10.48550/arxiv.2502.09621","metadata_source":"pith","pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mme-cot: Benchmarking chain-of-thought in large multimodal models for reasoning quality, robustness, and efficiency","venue":"cs.CV","work_id":"7d62286a-e2c2-4a9d-b440-5f218c4ec409","year":2025},"citing_paper":{"arxiv_id":"2605.19852","last_updated":"2026-06-03T11:11:28Z","snapshot_observed_at":"2026-08-13T09:24:20.626075Z","submitted_at":"2026-05-19T13:44:26Z","title":"Are Tools Always Beneficial? Learning to Invoke Tools Adaptively for Dual-Mode Multimodal LLM Reasoning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-20T06:16:47.650748Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2605.19852"},"observation_digest":"sha256:33542420954d89c9cf9f8fa6fbe6e5a0cc15efcd22c75ce8b99628a3e5f719ee","observation_id":"06e5d8b0-8dd7-4a95-84c8-b9f2c1406538","resolution":{"observed_at":"2026-05-20T06:18:05.202239Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":"2502.09621","doi":"10.48550/arxiv.2502.09621","metadata_source":"pith","pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mme-cot: Benchmarking chain-of-thought in large multimodal models for reasoning quality, robustness, and efficiency","venue":"cs.CV","work_id":"7d62286a-e2c2-4a9d-b440-5f218c4ec409","year":2025},"citing_paper":{"arxiv_id":"2606.05966","last_updated":"2026-06-04T10:07:05Z","snapshot_observed_at":"2026-07-06T23:45:51.910263Z","submitted_at":"2026-06-04T10:07:05Z","title":"Causal Scaffolding for Physical Reasoning: A Benchmark for Causally-Informed Physical World Understanding in VLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T23:15:38.962013Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2606.05966"},"observation_digest":"sha256:d8a15466f3e2e63b11d8501cd926e3469ddc012ab432595bdefd302047b3de6d","observation_id":"11673db8-5d71-4ee3-8f23-1c19f5468d58","resolution":{"observed_at":"2026-06-27T23:21:23.361183Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":"2502.09621","doi":"10.48550/arxiv.2502.09621","metadata_source":"pith","pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mme-cot: Benchmarking chain-of-thought in large multimodal models for reasoning quality, robustness, and efficiency","venue":"cs.CV","work_id":"7d62286a-e2c2-4a9d-b440-5f218c4ec409","year":2025},"citing_paper":{"arxiv_id":"2606.30378","last_updated":"2026-06-29T14:38:20Z","snapshot_observed_at":"2026-08-17T11:16:23.738867Z","submitted_at":"2026-06-29T14:38:20Z","title":"OmniCoT: A Benchmark for Global and Multi-Step Panoramic Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T06:11:09.693576Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2606.30378"},"observation_digest":"sha256:52c48897711c3bc596c6ada161c85946574b5132660cb499e5f59de1ecf6e4db","observation_id":"7ed23d51-c75d-4921-97f1-fbf624222c88","resolution":{"observed_at":"2026-06-30T06:14:19.152287Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":"arXiv preprint arXiv:2502.09621 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:11e7a7333f11993108639c092c1b267058dcba852d77d41e8d3c481a559858a5","observation_id":"77198966-2992-4550-b956-aed73dcacc83","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":"2502.09621","doi":"10.48550/arxiv.2502.09621","metadata_source":"pith","pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mme-cot: Benchmarking chain-of-thought in large multimodal models for reasoning quality, robustness, and efficiency","venue":"cs.CV","work_id":"7d62286a-e2c2-4a9d-b440-5f218c4ec409","year":2025},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:dccee6e3cee0f0675c1ff5ebc8516d1aaf6ff186f4681c8f6325b63df4886a5b","observation_id":"7a8a1784-94f6-4d85-9bb5-47133c928073","resolution":{"observed_at":"2026-07-10T01:46:40.945808Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.09621/citation-record","integrity":"/paper/2502.09621/integrity","json":"/paper/2502.09621/citation-record.json","paper":"/paper/2502.09621"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.221914Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.221914Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:8d3c8cc5dd7173f1f5a0718e8964e01555bd9988fd6209496fe5d83d051f0938","observation_id":"5268d74f-0072-4c18-9d41-55e57ef0b1e3","resolution":{"observed_at":"2026-08-07T20:52:33.221914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.225874Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.225874Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:cdd7136b39aeb866f33f6397c4aa238ce637765d8c4e6e30326e8169556b1a74","observation_id":"60c66316-3e0b-46d4-98f2-843bcc714195","resolution":{"observed_at":"2026-08-07T20:52:33.225874Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.707241Z","title":"step_index","venue":null,"work_id":"ae48cca1-8fc8-4f82-ba3f-5ae20cc38660","year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.229574Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:a851cd7dc4b33e78647ba99f449a9a45e5c4f253d083bde9d4fc7680145fe5b7","observation_id":"3d8a2952-ba3d-4120-a0d7-681deac05cc8","resolution":{"observed_at":"2026-08-07T20:52:33.710338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.543952Z","title":null,"venue":null,"work_id":"38122250-4a43-4918-b955-1d25006b6afe","year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.291073Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:9cbf4bac5f96d81141b86480deab10e839f4eedb56bcac7bddad1c1888cf1214","observation_id":"749ba094-bf85-43c2-89b7-cb04ac67f73c","resolution":{"observed_at":"2026-08-07T20:52:33.546733Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.500577Z","title":"Direct Evaluation Prompt Answer Extraction Prompt You are an AI assistant who will help me to extract an answer of a question","venue":null,"work_id":"48a08197-c062-432c-9a2b-f20d403df597","year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.311478Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:0d4f0ade9d729f9e2b82b4c123dbcb4b0cddf0b6c8caa02e7e6251278a30610f","observation_id":"832d0332-acf3-4264-a511-6511a964f633","resolution":{"observed_at":"2026-08-07T20:52:33.503790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.698049Z","title":null,"venue":null,"work_id":"c216f71c-9637-4a0f-bff9-6dce5d013e05","year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.233364Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:fa93fa12c40da449c36746706f6c8ea559b68596d952b15be10f653c95bddb93","observation_id":"1d09d559-de96-461e-9f8a-bcb115ffbfa3","resolution":{"observed_at":"2026-08-07T20:52:33.701082Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.688546Z","title":null,"venue":null,"work_id":"7cfafce7-bfcf-4d9d-9f0a-3d06765d6f05","year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.236863Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:bab3dd96aa5fcbaa9361150123f8a1ca0b234b3f57a34bb5e38e392ed379f02a","observation_id":"241ae9be-adf7-4cd6-b396-f9284dd70b26","resolution":{"observed_at":"2026-08-07T20:52:33.691491Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.240393Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.240393Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:9954fdefc534440699a1897029aff38b728a55e7d1f1cbff829af2eafcd57b12","observation_id":"7508e86b-7e80-43ac-9dac-77cc4b31164d","resolution":{"observed_at":"2026-08-07T20:52:33.240393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.673244Z","title":null,"venue":null,"work_id":"ae775fde-07d8-4027-be39-f7899d395604","year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.244126Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:fbbc5414ebba16b074f2cf718543817a08ef7f8d7d092ac29b74cea26d46e0ef","observation_id":"7342f0ae-4038-414c-a4c8-f818b9232e99","resolution":{"observed_at":"2026-08-07T20:52:33.676389Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.663779Z","title":null,"venue":null,"work_id":"0eca7c83-a1e1-43ee-9cbe-6b124418e108","year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.247459Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:80ab024a2d618846a02be982b58f76c86f42211c17f5485f147b957b6b55d0bb","observation_id":"e591a6b1-a6fc-46be-94cf-34dd91b75fa4","resolution":{"observed_at":"2026-08-07T20:52:33.667132Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.254203Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.254203Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:ad157f4a86510cb69460ed5fee1c6e9a626847510ab0c686b459b2c3fa94eeb7","observation_id":"746b7039-1864-4aba-8952-4eed97adca3b","resolution":{"observed_at":"2026-08-07T20:52:33.254203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.640952Z","title":"step_type","venue":null,"work_id":"0a50ffc4-0190-40d1-b97f-f2d78c9c61ca","year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.257705Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:690fe97f5cb4e009d3d4f3bd0818bec58ff5fb138e6bffe1aeed78bf8c38eed6","observation_id":"a29817cf-be52-47a9-bda6-8c4f82248fd9","resolution":{"observed_at":"2026-08-07T20:52:33.644550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.630069Z","title":null,"venue":null,"work_id":"b3467322-c007-4e34-8e4c-49c23a647691","year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.261219Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:171ead9afcb19eacfafeb39aa195d28aad1385e79690c77e73536e285a2ba319","observation_id":"21d869f2-4f1b-4ad2-a4ed-51e2f37e3a85","resolution":{"observed_at":"2026-08-07T20:52:33.633747Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.263903Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.263903Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:23445a0d2022f390ba0c0a4c29ee15db89d0bd67b6c4819df09ef9586ceef65e","observation_id":"3e9c6a3a-f02e-4225-b0e6-bf7d80d07348","resolution":{"observed_at":"2026-08-07T20:52:33.263903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.612483Z","title":"IMPORTANT NOTE: Evaluate relevancy independent of correctness","venue":null,"work_id":"ffafebb4-49bd-4c7e-bb4b-eda9805335f9","year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.266537Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:5bddb2baa4825495124ba81b94efb923443e535be93294ae4fcfbb683858bc64","observation_id":"1032d259-babe-4be4-b0f2-ae96d820a6e9","resolution":{"observed_at":"2026-08-07T20:52:33.616437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.601775Z","title":null,"venue":null,"work_id":"877aa5b6-044a-48b2-8bc2-80aeeff770fa","year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.269253Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:8a935186200936221b6b6b8ee602880d5e21160ee7e5163dd98c32cab51a35a9","observation_id":"11f8dde7-ef55-4020-aa0d-c3f958bf297b","resolution":{"observed_at":"2026-08-07T20:52:33.605578Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.592213Z","title":null,"venue":null,"work_id":"7d5b9792-6996-4a0e-83c1-4c261cd40332","year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.271846Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:bf94bb15c6a7e5da377a5f7ab1890c7fde969b257d877fe2fc8b6c3bd6edfe2d","observation_id":"da8972eb-e330-4557-807f-c1afbb1d641b","resolution":{"observed_at":"2026-08-07T20:52:33.595247Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.583186Z","title":"step_type","venue":null,"work_id":"2b27330d-dc8f-4ee1-9aa9-d6afb4ab55a9","year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.274406Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:28609280b33278956fe6b82efbd59f46ae10eeb8d978bf191b0ff88d166ed2fa","observation_id":"a4dad2aa-bddf-4ab1-bb8c-2ed28d09d63f","resolution":{"observed_at":"2026-08-07T20:52:33.586145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.277453Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.277453Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:530e029a27c79f8e1194737dcf5d43b05238df2fc229a3220795c3881c5d8d38","observation_id":"f229736c-cd06-4e7e-a4dd-3cb1bf080ef1","resolution":{"observed_at":"2026-08-07T20:52:33.277453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.280116Z","title":"Invalid reflections include:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.280116Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:b824a2d1dbc4734608ce5a206a94fe7ca46297396be81ffd5ecd874e05e84a9e","observation_id":"11e884f6-1d79-4d8a-9e0b-bb4a451af5dd","resolution":{"observed_at":"2026-08-07T20:52:33.280116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.282828Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.282828Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:4adfecf3ac9b75e326cca1bfd6618e7054156bee9fc4eb7a98407a8cd3bdd110","observation_id":"43507bb2-4e81-41b0-b8b2-08a2c2fd8f49","resolution":{"observed_at":"2026-08-07T20:52:33.282828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.285515Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.285515Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:d965a2926c438708aa0fe8935d6fb12537b74f09cd521f6218b325df91920712","observation_id":"d429e9d3-0ad0-423d-9e8c-2bfa7c08bdae","resolution":{"observed_at":"2026-08-07T20:52:33.285515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.288275Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.288275Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:1f16c436e4ffd98eb24c7159dadf6ec9d2408db50d16928ddfc57a0346494db3","observation_id":"3d04a9a0-b288-4756-af10-3de9cad5a1a4","resolution":{"observed_at":"2026-08-07T20:52:33.288275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.293949Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.293949Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:dbb26b2d92e93c6e0380c8423b0f7faa6293165b42d790f648815f2609be1dd7","observation_id":"2abfe026-ca1a-44b2-83d3-562527c2b609","resolution":{"observed_at":"2026-08-07T20:52:33.293949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.534849Z","title":"conclusion","venue":null,"work_id":"3169ca41-f9d4-4c13-8279-9350faacbbe5","year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.296767Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:56b171d160c344ab35d2f61e4186a40e5aaabc7a8576b051dc950b5e1781b1af","observation_id":"49ea6b87-a217-4af2-92ed-84ad8f2f2634","resolution":{"observed_at":"2026-08-07T20:52:33.537854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.299851Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.299851Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:32745b6fa56dd43a4058c115fb696a8a6c8d703248926cc0d58ba66bd6c8cae5","observation_id":"658fb650-a3c3-4139-a9a9-be57ba9058f8","resolution":{"observed_at":"2026-08-07T20:52:33.299851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.302709Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.302709Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:ad4778c616c3dad8a2b418a883a969dfa0f1d20fa08a074190d32c794d3cd33b","observation_id":"efc26d3b-6a51-4a2a-90cd-51fabbc5dad7","resolution":{"observed_at":"2026-08-07T20:52:33.302709Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.305751Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.305751Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:b187bf65649d92d86be063894fd840b9cc4c3ca97bd13b7c32a53143e9f8c745","observation_id":"2eecf3a5-432c-43e4-ad94-76153ff480ea","resolution":{"observed_at":"2026-08-07T20:52:33.305751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.308518Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.308518Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:d2c1a4ded72d92358a168ea909b13e21e6c7bb8ab6ec2302e8a061ca8cc7b14a","observation_id":"e986f230-4515-4aff-b65d-5014966819f2","resolution":{"observed_at":"2026-08-07T20:52:33.308518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.491375Z","title":"You should directly output the choice letter of the answer","venue":null,"work_id":"ab7d339e-7a33-4dad-9931-ecd0dc73a78f","year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.314304Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:acf3093576fdb00b1c9bcb2b720568a257bd37270f1684aecc4cd53341426bef","observation_id":"9b0884fd-23a3-4fe6-bbcc-285e116b8222","resolution":{"observed_at":"2026-08-07T20:52:33.494822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.481716Z","title":null,"venue":null,"work_id":"36938de0-7b58-4f26-90c7-08a2bdd849ba","year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.317252Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:54c2942c832adba3c352aadff8ffbc704fe726adbf639d5012250fe308f86254","observation_id":"6bb9ab0a-e049-4ff1-b1fd-3479e22a0c0c","resolution":{"observed_at":"2026-08-07T20:52:33.485104Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.472610Z","title":"[Non Multiple choice question]","venue":null,"work_id":"95141d85-11de-4a85-8d06-eda997c61580","year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.320125Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:41d08bc22f70e7e03d78c7df8d6679ab5dcf27971c22eb2c547f9437d3b6d51a","observation_id":"1e297348-8193-4029-9ab6-177516bf3c7f","resolution":{"observed_at":"2026-08-07T20:52:33.475485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.463219Z","title":"It could be hidden inside the last step of calculation or inference","venue":null,"work_id":"45900565-d0a4-47d5-9541-8edbfa635f0b","year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.323273Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:d53c215f87670b34df88439ddb7c69ab5cd8902a62abaf585f8c78d440bb21a4","observation_id":"8796a0ba-ad41-48ae-89d1-40a8783cbe91","resolution":{"observed_at":"2026-08-07T20:52:33.466549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.453815Z","title":null,"venue":null,"work_id":"32d66b8e-4d2b-408b-a188-618ac016529a","year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.326384Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:949b1b33e5b85bdfff47398048ff0e4e0f5433bb117c5fd2dba5498128f12a33","observation_id":"fd13c4a4-d569-4979-a6eb-28eafebd606c","resolution":{"observed_at":"2026-08-07T20:52:33.456824Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.443917Z","title":"Output Format: Directly output the extracted answer of the response","venue":null,"work_id":"b36aac88-8d40-4964-af1e-0300d29e7184","year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.329142Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:85da85bb1cf7508aa09fd878a4a30b5774aa1b7797b9accd5996fe2ff070be18","observation_id":"48afadfc-f93a-4090-8f79-e0d194c86a7f","resolution":{"observed_at":"2026-08-07T20:52:33.447385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.432733Z","title":null,"venue":null,"work_id":"46d8ed84-4d24-4ea8-ad9d-fba5e1fe1729","year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.332115Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:88aaea5d658a104934f3e44b0f4e5f2e468122870a9c5ac6a6b0ae7ba9754228","observation_id":"bc756eaa-48ea-4aa0-a715-10c6b348493b","resolution":{"observed_at":"2026-08-07T20:52:33.436429Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.421716Z","title":"[Nan-Multiple-Choice questions]","venue":null,"work_id":"fd40ea9e-05d9-43ac-923b-2605eca8d930","year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.334774Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:11eecf24aafd11da6c4da8d6a3700881d3edfcd77048ebb7b60147d49ce0895a","observation_id":"f3237c9e-de57-449e-b153-4bacada0e294","resolution":{"observed_at":"2026-08-07T20:52:33.425389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.410312Z","title":null,"venue":null,"work_id":"6749c4aa-f1ce-49b5-85fe-a9ea9628d2a4","year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.337498Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:35e966463a9d6b3c4d7dada27d4a3ef8276afd644009d2aa144b915ca42622eb","observation_id":"a4529c65-ed23-4002-a967-8c6ca0b8cbf9","resolution":{"observed_at":"2026-08-07T20:52:33.414076Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.399336Z","title":"Output Format: 1","venue":null,"work_id":"ba40e794-be81-4454-97f2-ff105be6e8ac","year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.340188Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:6b539fc5a694551a8c66209520e1a7af339a5d9069f25ae767c2acf0ff450cd6","observation_id":"f6f4944a-4182-4228-97af-349f37cbc016","resolution":{"observed_at":"2026-08-07T20:52:33.402824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:52:33.387731Z","title":"{In Context Examples} Question: {question} [Model Answer]: {extract answer} [Standard Answer]: {gt answer} Your output: 35","venue":null,"work_id":"64370926-6587-46a8-aa78-9c5b124ab44e","year":null},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.342830Z"},"links":{"citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:8cae42c7413e349b6f71dfbeae7fd970a5a9a5548050dd8a417961b17dcca2a0","observation_id":"ee09987c-0794-45a9-96ca-92086d10a819","resolution":{"observed_at":"2026-08-07T20:52:33.392727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12183","last_updated":"2025-05-07T18:00:45Z","snapshot_observed_at":"2026-08-19T12:27:53.107321Z","submitted_at":"2024-09-18T17:55:00Z","title":"To CoT or not to CoT? Chain-of-thought helps mainly on math and symbolic reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12183","snapshot_observed_at":"2026-08-07T20:52:33.212667Z","title":"org/CorpusID:231591445","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.212667Z"},"links":{"cited_paper":"/paper/2409.12183","citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:6f42de6aaa97f3880bc1abe8c28ce867a274b9ac6f67443a1de3709dcb8d9751","observation_id":"20d4ca02-ffc5-4564-a8f9-efdfbc6e8cab","resolution":{"observed_at":"2026-08-07T20:52:33.212667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T20:52:33.216898Z","title":"a\" and \"b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T20:52:33.216898Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2502.09621"},"observation_digest":"sha256:78bf0b8cd01e9d1f2514ddd857eef825409942c1f18d739801795362c14377c5","observation_id":"7d918680-6fd7-4a71-929a-1afd04f8f45e","resolution":{"observed_at":"2026-08-07T20:52:33.216898Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":2,"unresolved":26,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 32 inbound Pith citation observations for arXiv:2502.09621."}