{"as_of":"2026-08-08T03:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:22aed3c7bf3396dcc4e54565ad8582815396f0047aeac7d09a231b7089f26365","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":40,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:29:06.836442Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T13:09:50.233935Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":"2501.05444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-04T13:09:50.233935Z","title":"W., Li, L., Yang, Z., Wang, L., and Cheng, Y","venue":null,"work_id":"3684bdb2-838f-4727-be6b-797dcc466fdf","year":2025},"citing_paper":{"arxiv_id":"2502.02871","last_updated":"2026-04-20T02:18:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-05T04:05:27Z","title":"Position: Multimodal Large Language Models Can Significantly Advance Scientific Reasoning","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-23T04:30:38.804702Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2502.02871"},"observation_digest":"sha256:1365fc2829db827d4738e510a047dec7f6271d1bf1595069719d3d11816edad5","observation_id":"59217165-9cd2-4838-ace1-1f645cccb2b2","resolution":{"observed_at":"2026-05-23T04:32:32.840359Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":"2501.05444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-04T13:09:50.233935Z","title":"W., Li, L., Yang, Z., Wang, L., and Cheng, Y","venue":null,"work_id":"3684bdb2-838f-4727-be6b-797dcc466fdf","year":2025},"citing_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"reference_index":241,"source":"pdf_text","source_observed_at":"2026-05-12T08:40:40.910461Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2503.09567"},"observation_digest":"sha256:ecee283b98185656cd8bbb63659504dcaa2b5e721d5d443e0d7eb3e400f0fc81","observation_id":"bea1f8ac-2ae8-4271-97b5-1c28b2ddafb2","resolution":{"observed_at":"2026-05-12T08:40:41.471398Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":"2501.05444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-04T13:09:50.233935Z","title":"W., Li, L., Yang, Z., Wang, L., and Cheng, Y","venue":null,"work_id":"3684bdb2-838f-4727-be6b-797dcc466fdf","year":2025},"citing_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"reference_index":167,"source":"pdf_text","source_observed_at":"2026-05-15T17:18:52.996467Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2503.12605"},"observation_digest":"sha256:1fa2ca74d0ed5f965c8f262a782f7334b3a746262bc376328d9cd592b1b20875","observation_id":"fc20a570-a8c1-499f-a529-97c46d9fcd85","resolution":{"observed_at":"2026-05-15T17:18:53.278400Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":"2501.05444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-04T13:09:50.233935Z","title":"W., Li, L., Yang, Z., Wang, L., and Cheng, Y","venue":null,"work_id":"3684bdb2-838f-4727-be6b-797dcc466fdf","year":2025},"citing_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-19T06:59:03.112252Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2503.17352"},"observation_digest":"sha256:f0c2eed07484ebc3d89465bcbd2003925c9974957d18ffc38449bd5270d966ed","observation_id":"a431e228-57cb-4df6-a848-fcc25fc8e8f5","resolution":{"observed_at":"2026-05-19T06:59:03.400181Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":"2501.05444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-04T13:09:50.233935Z","title":"W., Li, L., Yang, Z., Wang, L., and Cheng, Y","venue":null,"work_id":"3684bdb2-838f-4727-be6b-797dcc466fdf","year":2025},"citing_paper":{"arxiv_id":"2504.14945","last_updated":"2025-06-22T00:18:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-21T08:09:13Z","title":"Learning to Reason under Off-Policy Guidance","version":5},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-15T23:17:02.701393Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2504.14945"},"observation_digest":"sha256:db9ac62948f42e61c98265822395c187dc91c565df2c879c040997ee98429c41","observation_id":"6de50937-63e5-4a52-8c9a-237f56fc1afa","resolution":{"observed_at":"2026-05-15T23:17:02.892270Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-07T15:29:06.836442Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15000","last_updated":"2025-05-21T01:07:00Z","snapshot_observed_at":"2026-08-07T15:23:25.479987Z","submitted_at":"2025-05-21T01:07:00Z","title":"Towards Spoken Mathematical Reasoning: Benchmarking Speech-based Models over Multi-faceted Math Problems","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T15:29:06.836442Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2505.15000"},"observation_digest":"sha256:1e626f02991102728ce2c884870fcc77bc5157bb4bb3719df6956157c9e09f94","observation_id":"ca4d68d7-8604-484e-b562-19be0e03b0cf","resolution":{"observed_at":"2026-08-07T15:29:06.836442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-07T15:26:59.566161Z","title":"arXiv preprint arXiv:2501.05444 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15146","last_updated":"2025-06-03T09:53:37Z","snapshot_observed_at":"2026-08-07T21:22:21.405277Z","submitted_at":"2025-05-21T06:02:55Z","title":"lmgame-Bench: How Good are LLMs at Playing Games?","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:59.566161Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2505.15146"},"observation_digest":"sha256:3af3537cef037cd3734f1e4b6d978ca937949fd4e8f6d098ceecfa2666045dd4","observation_id":"8cafd74e-8f58-4fde-a158-02ea21ec09c9","resolution":{"observed_at":"2026-08-07T15:26:59.566161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-07T15:14:56.253584Z","title":"the fair use of a copyrighted work, including such use by ...... scholarship, or research, is not an infringement of copyright","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15929","last_updated":"2025-05-29T17:59:14Z","snapshot_observed_at":"2026-08-07T15:08:06.803620Z","submitted_at":"2025-05-21T18:33:50Z","title":"PhyX: Does Your Model Have the \"Wits\" for Physical Reasoning?","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:56.253584Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2505.15929"},"observation_digest":"sha256:339b1c5adcebc14454f5ec03e8894aab851af67bdbe8f7ca803b30968eb7a861","observation_id":"3269c397-9cf3-456c-a0c7-69b46502952b","resolution":{"observed_at":"2026-08-07T15:14:56.253584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-07T14:51:16.478809Z","title":"Can mllms reason in multimodality? emma: An enhanced multimodal reasoning benchmark,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17399","last_updated":"2025-05-26T11:15:36Z","snapshot_observed_at":"2026-08-07T14:45:38.156584Z","submitted_at":"2025-05-23T02:16:11Z","title":"FullFront: Benchmarking MLLMs Across the Full Front-End Engineering Workflow","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:16.478809Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2505.17399"},"observation_digest":"sha256:b6ef727f68e98931afad8dbd8687870ec843d2be52c36777bdcd88770e472b92","observation_id":"13c6dd49-fa38-4685-86aa-7bee9f02578a","resolution":{"observed_at":"2026-08-07T14:51:16.478809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-07T14:31:14.468895Z","title":"Can mllms reason in multimodality? emma: An enhanced multimodal reasoning benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:14.468895Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:ace59aa4007a6c023b96d08e1e46ee01fb2c4f38ccb53e1ffb98a7b413302aac","observation_id":"e892892b-c10d-45a6-8065-9432d3feab2f","resolution":{"observed_at":"2026-08-07T14:31:14.468895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-07T14:19:02.650097Z","title":"Can mllms reason in multimodality? emma: An enhanced multimodal reasoning benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19406","last_updated":"2025-05-26T01:42:38Z","snapshot_observed_at":"2026-08-07T20:32:06.174757Z","submitted_at":"2025-05-26T01:42:38Z","title":"Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:02.650097Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2505.19406"},"observation_digest":"sha256:90de551a06c20562bfdecfe1cdb6c07b7643691396d64565460b9c2d96d37a0f","observation_id":"82ab3d3d-13f9-4382-8cf0-d5cfdb58dcb1","resolution":{"observed_at":"2026-08-07T14:19:02.650097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-07T14:12:03.859705Z","title":"Can mllms reason in multimodality? emma: An enhanced multimodal reasoning benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19702","last_updated":"2025-05-26T08:54:14Z","snapshot_observed_at":"2026-08-07T22:12:59.102228Z","submitted_at":"2025-05-26T08:54:14Z","title":"Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:03.859705Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2505.19702"},"observation_digest":"sha256:9f11dd2be05f0fe1f9bd53466e255803e272f3abfdf44639b9b28b567853a600","observation_id":"0af8138d-b50b-4120-96ae-298ddf751c9a","resolution":{"observed_at":"2026-08-07T14:12:03.859705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-07T13:35:57.253578Z","title":"Can mllms reason in multimodality? emma: An enhanced multimodal reasoning benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21327","last_updated":"2025-05-27T15:23:23Z","snapshot_observed_at":"2026-08-07T13:27:31.159147Z","submitted_at":"2025-05-27T15:23:23Z","title":"MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:57.253578Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2505.21327"},"observation_digest":"sha256:73a3d00d9e2ccc8710f363d155870e4da232e69928d26332b8a71a313c96241b","observation_id":"060b87ff-030b-457b-bbd4-e859554de971","resolution":{"observed_at":"2026-08-07T13:35:57.253578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-07T12:41:01.334554Z","title":"Can mllms reason in multimodality? emma: An enhanced multimodal reasoning benchmark.arXiv preprint arXiv:2501.05444, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:01.334554Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:bb4c0de273d769994fb739fd5880a7ccc5713e0e97aeec720fc3d358ed5013fd","observation_id":"df31dd7b-4de3-468f-8f15-7c3087c86cca","resolution":{"observed_at":"2026-08-07T12:41:01.334554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-07T12:36:21.244871Z","title":"Can mllms reason in multimodality? emma: An enhanced multimodal reasoning benchmark.arXiv preprint arXiv:2501.05444, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:21.244871Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:2703bf53a7d1f1f56e1f599a791b5b13ef49e893aeb905816eae457216d8df83","observation_id":"a5964cce-ce42-4bca-9940-f8b194a075a7","resolution":{"observed_at":"2026-08-07T12:36:21.244871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-07T05:25:30.367946Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced Multi- Modal ReAsoning Benchmark, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.367946Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:f93c4211c576c74d47bc658ba52ef750c949cfbdfc76d9fe8582488af555a176","observation_id":"58541b15-d921-4064-b89d-6dee79b1e6b8","resolution":{"observed_at":"2026-08-07T05:25:30.367946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-07T05:19:16.540534Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08343","last_updated":"2025-06-18T14:43:36Z","snapshot_observed_at":"2026-08-07T08:58:45.702180Z","submitted_at":"2025-06-10T01:54:04Z","title":"Wait, We Don't Need to \"Wait\"! Removing Thinking Tokens Improves Reasoning Efficiency","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T05:19:16.540534Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2506.08343"},"observation_digest":"sha256:4f25a659c964b1dcf8b64ebb282a51ea26eeec183756221e00b56bab98cd92f5","observation_id":"c27708dd-cd6c-4f19-9f5c-898587f63c4b","resolution":{"observed_at":"2026-08-07T05:19:16.540534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-07T04:40:08.211304Z","title":"Can mllms reason in multimodality? emma: An enhanced multimodal reasoning benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-08T03:17:29.512287Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:08.211304Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:6e6c4276fcfe0aeb8810f8f7d68f29da9b2f06064ed66e16955ff34e38a2732c","observation_id":"9024f7a6-09d5-44b8-a2c3-b8d1e33ac7af","resolution":{"observed_at":"2026-08-07T04:40:08.211304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-06T21:58:34.684819Z","title":"Can MLLMs reason in multimodality? EMMA: an enhanced multimodal reasoning benchmark.arXiv preprint arXiv:2501.05444, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22992","last_updated":"2025-06-28T19:44:32Z","snapshot_observed_at":"2026-08-07T21:22:24.280259Z","submitted_at":"2025-06-28T19:44:32Z","title":"MARBLE: A Hard Benchmark for Multimodal Spatial Reasoning and Planning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:34.684819Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2506.22992"},"observation_digest":"sha256:9fdd0c4eabdebaf0bc8d660fa3dc3710278de383bce88164039e5c7164df1eb7","observation_id":"55df135a-9ca6-4fe7-ad75-4bb19f440d8c","resolution":{"observed_at":"2026-08-06T21:58:34.684819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-06T19:14:03.335779Z","title":"Can mllms reason in multimodality? emma: An enhanced multimodal reasoning benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06167","last_updated":"2025-07-10T15:41:04Z","snapshot_observed_at":"2026-08-07T10:37:03.707334Z","submitted_at":"2025-07-08T16:47:16Z","title":"Skywork-R1V3 Technical Report","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T19:14:03.335779Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2507.06167"},"observation_digest":"sha256:1a76a1def302b1b1520acf4acf13fc74a4a0ae3e8a2c4691920ec035bdb6727f","observation_id":"d1c9e39c-da3b-451e-b3c2-7c06538b096d","resolution":{"observed_at":"2026-08-06T19:14:03.335779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-06T11:35:11.882839Z","title":"Can mllms reason in multimodality? emma: An enhanced multimodal reasoning benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22607","last_updated":"2025-07-31T09:09:45Z","snapshot_observed_at":"2026-08-06T11:35:06.948357Z","submitted_at":"2025-07-30T12:23:21Z","title":"VL-Cogito: Progressive Curriculum Reinforcement Learning for Advanced Multimodal Reasoning","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T11:35:11.882839Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2507.22607"},"observation_digest":"sha256:9180fbd9f795e6c3689f3278eae7b12ee099deaedcf86fb22ecffeb1b4020153","observation_id":"b7ae7c65-1c24-4eef-8281-58c46bfdc0d1","resolution":{"observed_at":"2026-08-06T11:35:11.882839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-05T16:32:42.934041Z","title":"Can mllms reason in multimodality? emma: An enhanced multimodal reasoning benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-06T03:45:09.032927Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.934041Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:1c55f714695bcf0592bcdcd91290920a6c841af7fef425b796ebdea4561b4728","observation_id":"9d5b0801-966a-45f1-9e27-1ecb18d0c745","resolution":{"observed_at":"2026-08-05T16:32:42.934041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-05T15:23:52.822183Z","title":"arXiv preprint arXiv:2501.05444","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19944","last_updated":"2025-08-31T10:33:09Z","snapshot_observed_at":"2026-08-07T21:49:21.651871Z","submitted_at":"2025-08-27T15:01:02Z","title":"KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T15:23:52.822183Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2508.19944"},"observation_digest":"sha256:92bd88b7a25fca67d4fe076fd3a5f8c7f0b111713fa0acdf6e8697be2b7b4e27","observation_id":"f86f6a0d-31ae-4ba1-9bb2-869119a11ede","resolution":{"observed_at":"2026-08-05T15:23:52.822183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-05T13:24:39.653975Z","title":"Can mllms reason in multimodality? emma: An enhanced multimodal reasoning benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.653975Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:715ed983026c49736dc3461fffd684f47ec1952cefa8ea1c783b9c712646f1ea","observation_id":"aa570e30-2544-4fe1-8f67-24262a221426","resolution":{"observed_at":"2026-08-05T13:24:39.653975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":"2501.05444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-04T13:09:50.233935Z","title":"W., Li, L., Yang, Z., Wang, L., and Cheng, Y","venue":null,"work_id":"3684bdb2-838f-4727-be6b-797dcc466fdf","year":2025},"citing_paper":{"arxiv_id":"2509.18154","last_updated":"2025-09-16T19:41:48Z","snapshot_observed_at":"2026-07-06T22:30:31.933240Z","submitted_at":"2025-09-16T19:41:48Z","title":"MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Recipe","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-15T17:07:27.277040Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2509.18154"},"observation_digest":"sha256:3f00f8fbfb547b5e80eb8a97f0b1d1257f59d46a9514757a5c34eb8962edc9e5","observation_id":"c66eeefd-99ec-410e-8435-a40e3634a2e5","resolution":{"observed_at":"2026-05-15T17:07:27.398933Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":"2501.05444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-04T13:09:50.233935Z","title":"W., Li, L., Yang, Z., Wang, L., and Cheng, Y","venue":null,"work_id":"3684bdb2-838f-4727-be6b-797dcc466fdf","year":2025},"citing_paper":{"arxiv_id":"2511.23253","last_updated":"2026-05-17T14:28:57Z","snapshot_observed_at":"2026-08-02T03:33:31.761191Z","submitted_at":"2025-11-28T15:02:19Z","title":"AgroCoT: A Chain-of-Thought Benchmark for Evaluating Reasoning in Vision-Language Models for Agriculture","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T17:59:42.921867Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2511.23253"},"observation_digest":"sha256:2d3336bcb15b93cf2af13fa6e06c32288974b04b4f85ed4c4567fd44876018fd","observation_id":"b5e52865-c1e2-4a43-b5f1-2576227b5ab7","resolution":{"observed_at":"2026-05-21T18:00:26.874973Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-03T05:23:33.121778Z","title":"W., Li, L., Yang, Z., Wang, L., and Cheng, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02465","last_updated":"2026-06-10T12:52:04Z","snapshot_observed_at":"2026-08-06T08:05:14.430571Z","submitted_at":"2026-02-02T18:49:06Z","title":"MentisOculi: Revealing the Limits of Reasoning with Mental Imagery","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T05:23:33.121778Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2602.02465"},"observation_digest":"sha256:fdf167d60c0b8446d0b1af8fc8aa49eaa1433a45b151917367ce730e5b6d2386","observation_id":"aa028a27-b5f1-47b4-99c1-6f0219a0a6b1","resolution":{"observed_at":"2026-08-03T05:23:33.121778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-02T20:36:04.457394Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.22971","last_updated":"2026-05-29T07:44:51Z","snapshot_observed_at":"2026-08-06T11:32:52.767125Z","submitted_at":"2026-02-26T13:08:56Z","title":"SPM-Bench: Benchmarking Large Language Models for Scanning Probe Microscopy","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T20:36:04.457394Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2602.22971"},"observation_digest":"sha256:c7ca2a30f7eb31ba0d0b8ae906c860d012dcd2af08620c4a600ea9e9c8075d73","observation_id":"b8dcbd05-29aa-456e-a0fa-05bb7fc6ef92","resolution":{"observed_at":"2026-08-02T20:36:04.457394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":"2501.05444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-04T13:09:50.233935Z","title":"W., Li, L., Yang, Z., Wang, L., and Cheng, Y","venue":null,"work_id":"3684bdb2-838f-4727-be6b-797dcc466fdf","year":2025},"citing_paper":{"arxiv_id":"2603.20633","last_updated":"2026-04-17T08:57:17Z","snapshot_observed_at":"2026-07-06T22:49:57.103822Z","submitted_at":"2026-03-21T04:03:45Z","title":"Seed1.8 Model Card: Towards Generalized Real-World Agency","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T07:44:02.827006Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2603.20633"},"observation_digest":"sha256:d07a6aaa2bba578765a407053e60fb390e0882423bb25e96aba6f7196a98d2a4","observation_id":"314fcb5f-e6d6-4dd8-9e5f-f82c27d3b6bf","resolution":{"observed_at":"2026-05-15T07:45:14.287576Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":"2501.05444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-04T13:09:50.233935Z","title":"W., Li, L., Yang, Z., Wang, L., and Cheng, Y","venue":null,"work_id":"3684bdb2-838f-4727-be6b-797dcc466fdf","year":2025},"citing_paper":{"arxiv_id":"2604.20183","last_updated":"2026-06-02T10:46:47Z","snapshot_observed_at":"2026-08-02T22:19:27.963593Z","submitted_at":"2026-04-22T04:55:31Z","title":"Dual-Cluster Memory Agent: Resolving Multi-Paradigm Ambiguity in Optimization Problem Solving","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-10T00:37:55.147350Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2604.20183"},"observation_digest":"sha256:e2f723b39ddec47e44471db28474d32a369b8e1a7d527ee605ca4875e6155e14","observation_id":"fabe2c58-eaca-4c41-9005-42d8daed444e","resolution":{"observed_at":"2026-05-11T13:46:04.311521Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":"2501.05444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-04T13:09:50.233935Z","title":"W., Li, L., Yang, Z., Wang, L., and Cheng, Y","venue":null,"work_id":"3684bdb2-838f-4727-be6b-797dcc466fdf","year":2025},"citing_paper":{"arxiv_id":"2604.21510","last_updated":"2026-04-23T10:12:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T10:12:32Z","title":"OptiVerse: A Comprehensive Benchmark towards Optimization Problem Solving","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-05-09T22:04:19.654714Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2604.21510"},"observation_digest":"sha256:ded8da8dada855aa8f62ce97829c0493e0ed78a61b85342f3184243ddf9a32e2","observation_id":"3325c29f-6bc7-4f06-b15b-841b61ccdeb9","resolution":{"observed_at":"2026-05-11T14:21:03.874703Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":"2501.05444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-04T13:09:50.233935Z","title":"W., Li, L., Yang, Z., Wang, L., and Cheng, Y","venue":null,"work_id":"3684bdb2-838f-4727-be6b-797dcc466fdf","year":2025},"citing_paper":{"arxiv_id":"2605.09614","last_updated":"2026-05-10T15:53:11Z","snapshot_observed_at":"2026-07-31T22:46:33.839024Z","submitted_at":"2026-05-10T15:53:11Z","title":"Reflection Anchors for Propagation-Aware Visual Retention in Long-Chain Multimodal Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-12T02:24:12.349405Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2605.09614"},"observation_digest":"sha256:020af5889e305fa1d44829c994c2a2755d834909bba124fd744a095d377887e8","observation_id":"67764f88-0862-4b1c-9f4a-002e83632f6b","resolution":{"observed_at":"2026-05-12T07:41:27.517349Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":"2501.05444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-04T13:09:50.233935Z","title":"W., Li, L., Yang, Z., Wang, L., and Cheng, Y","venue":null,"work_id":"3684bdb2-838f-4727-be6b-797dcc466fdf","year":2025},"citing_paper":{"arxiv_id":"2605.14054","last_updated":"2026-06-02T19:43:46Z","snapshot_observed_at":"2026-07-06T23:25:29.856145Z","submitted_at":"2026-05-13T19:23:53Z","title":"Bad Seeing or Bad Thinking? Rewarding Perception for Multimodal Reasoning","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-05-15T05:14:28.256032Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2605.14054"},"observation_digest":"sha256:c2e05ffd9aa81f3b54a2406caf389f27bb866e124730c235fd56cbf3e1341cb9","observation_id":"edaac7b9-5988-4235-82c7-2e1c8513f50e","resolution":{"observed_at":"2026-05-15T05:15:02.884007Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":"2501.05444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-04T13:09:50.233935Z","title":"W., Li, L., Yang, Z., Wang, L., and Cheng, Y","venue":null,"work_id":"3684bdb2-838f-4727-be6b-797dcc466fdf","year":2025},"citing_paper":{"arxiv_id":"2605.15792","last_updated":"2026-05-15T09:48:46Z","snapshot_observed_at":"2026-08-08T03:23:41.035935Z","submitted_at":"2026-05-15T09:48:46Z","title":"Reversing the Flow: Generation-to-Understanding Synergy in Large Multimodal Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T18:44:54.835575Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2605.15792"},"observation_digest":"sha256:433f1ce0fc3c649de85f8e205fd26414e227e9eadabe661bb2ac5bd696a993be","observation_id":"eb529714-10e1-4e6b-88ff-28e8a71ad0a3","resolution":{"observed_at":"2026-05-20T18:48:53.490345Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":"2501.05444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-04T13:09:50.233935Z","title":"W., Li, L., Yang, Z., Wang, L., and Cheng, Y","venue":null,"work_id":"3684bdb2-838f-4727-be6b-797dcc466fdf","year":2025},"citing_paper":{"arxiv_id":"2605.25571","last_updated":"2026-05-25T08:26:34Z","snapshot_observed_at":"2026-07-06T23:35:31.372756Z","submitted_at":"2026-05-25T08:26:34Z","title":"AnE: Pushing the Reasoning Frontier of Multimodal LLMs via Anchor Evolution","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-29T22:56:39.504430Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2605.25571"},"observation_digest":"sha256:d81da861789d938f86a01f35bec1d9ef67c045d446126a2c72295c297898471c","observation_id":"7e1c70c0-7481-4bd7-af97-e107c43eae73","resolution":{"observed_at":"2026-06-30T00:14:04.635099Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":"2501.05444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-04T13:09:50.233935Z","title":"W., Li, L., Yang, Z., Wang, L., and Cheng, Y","venue":null,"work_id":"3684bdb2-838f-4727-be6b-797dcc466fdf","year":2025},"citing_paper":{"arxiv_id":"2606.05966","last_updated":"2026-06-04T10:07:05Z","snapshot_observed_at":"2026-07-06T23:45:51.910263Z","submitted_at":"2026-06-04T10:07:05Z","title":"Causal Scaffolding for Physical Reasoning: A Benchmark for Causally-Informed Physical World Understanding in VLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T23:15:38.962013Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2606.05966"},"observation_digest":"sha256:9bffa4489d808d43d718f209c2ca2444307b96185d970ccfc68fafbb86b07391","observation_id":"41f675df-f331-4c6b-9d3f-3dd540b15384","resolution":{"observed_at":"2026-07-02T15:57:06.715624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":"2501.05444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-04T13:09:50.233935Z","title":"W., Li, L., Yang, Z., Wang, L., and Cheng, Y","venue":null,"work_id":"3684bdb2-838f-4727-be6b-797dcc466fdf","year":2025},"citing_paper":{"arxiv_id":"2606.26535","last_updated":"2026-06-25T02:18:38Z","snapshot_observed_at":"2026-08-06T19:33:14.892044Z","submitted_at":"2026-06-25T02:18:38Z","title":"From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T05:31:17.461916Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2606.26535"},"observation_digest":"sha256:2ebb7f7c03b4a76a994718a2fa68bbb94f2e555735694e5034e7596dfb8d0dfa","observation_id":"01469653-fd64-47f6-bc32-e6f8c0ffde20","resolution":{"observed_at":"2026-07-04T13:09:50.235779Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":"2501.05444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-04T13:09:50.233935Z","title":"W., Li, L., Yang, Z., Wang, L., and Cheng, Y","venue":null,"work_id":"3684bdb2-838f-4727-be6b-797dcc466fdf","year":2025},"citing_paper":{"arxiv_id":"2607.00248","last_updated":"2026-06-30T22:57:43Z","snapshot_observed_at":"2026-08-03T15:00:12.134373Z","submitted_at":"2026-06-30T22:57:43Z","title":"Seed2.0 Model Card: Towards Intelligence Frontier for Real-World Complexity","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-02T18:57:46.841456Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2607.00248"},"observation_digest":"sha256:523e3cca5a5c8d78dceb74ec452249fa57162bebf9273b629577279aa53825c9","observation_id":"dcc576b0-35a1-4d70-8ba8-bdb99db859d1","resolution":{"observed_at":"2026-07-02T19:07:17.410212Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":"arXiv preprint arXiv:2501.05444 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-02T18:53:38.421944Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:46b048295546618bade111a13ec49e1ef3ad2ea32b0d76b5e2ce88678f373987","observation_id":"1ad6a5de-5851-4a93-8ca7-e9b1d05f83b4","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-31T05:01:28.384980Z","title":"arXiv preprint arXiv:2501.05444 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:28.384980Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:bd36193cc53395b79f2f92fe329e9245eb093f3c83b3a2bdc8f23b1bd0029af7","observation_id":"e6992855-794e-4037-b7d3-00ab9c601dcb","resolution":{"observed_at":"2026-07-31T05:01:28.384980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.05444/citation-record","integrity":"/paper/2501.05444/integrity","json":"/paper/2501.05444/citation-record.json","paper":"/paper/2501.05444"},"outbound":[],"paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 40 inbound Pith citation observations for arXiv:2501.05444."}