{"as_of":"2026-08-07T08:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e881479c6ab9becc0e72168996b1d44e4aa6dca3f73a6b831c6e56d115bb8048","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:41:41.103071Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T16:07:45.693853Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T15:04:22.765546Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"cited_work":{"arxiv_id":"2506.23563","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23563","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmreason: An open-ended multi-modal multi-step reasoning benchmark for mllms to- ward agi","venue":null,"work_id":"13427a83-3dfb-41be-a24c-7a8f8e9790b5","year":2025},"citing_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-06T21:34:54.534751Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-16T15:04:22.690503Z"},"links":{"cited_paper":"/paper/2506.23563","citing_paper":"/paper/2503.12937"},"observation_digest":"sha256:e38b2ddfe1e8233976413e199d9738bd0abde469530999d154b109a05d6780c7","observation_id":"41cb0031-bb58-4119-abee-969cf25cdbb7","resolution":{"observed_at":"2026-05-16T15:04:22.768219Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23563","snapshot_observed_at":"2026-08-04T16:07:45.693853Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-04T16:07:24.699834Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":224,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:45.693853Z"},"links":{"cited_paper":"/paper/2506.23563","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:ffbd3615aceff455d468a8c8fa7f68c14c0e8db542f6f2b491fbd48f1cc2eac1","observation_id":"54e58cba-4bf8-433d-a37c-d4188b30aaea","resolution":{"observed_at":"2026-08-04T16:07:45.693853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"cited_work":{"arxiv_id":"2506.23563","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23563","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmreason: An open-ended multi-modal multi-step reasoning benchmark for mllms to- ward agi","venue":null,"work_id":"13427a83-3dfb-41be-a24c-7a8f8e9790b5","year":2025},"citing_paper":{"arxiv_id":"2604.20806","last_updated":"2026-04-22T17:37:40Z","snapshot_observed_at":"2026-08-02T21:32:46.195325Z","submitted_at":"2026-04-22T17:37:40Z","title":"OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-10T00:40:47.562861Z"},"links":{"cited_paper":"/paper/2506.23563","citing_paper":"/paper/2604.20806"},"observation_digest":"sha256:20ac0dd5d23044a2b97c2abaac6bcc94374de77a713703f45ca12a1a7902fdef","observation_id":"8c7ca8d1-37a3-4a88-9c36-c51ee1825ca8","resolution":{"observed_at":"2026-05-11T13:46:03.540546Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.23563/citation-record","integrity":"/paper/2506.23563/integrity","json":"/paper/2506.23563/citation-record.json","paper":"/paper/2506.23563"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:36.964984Z","title":"Vqa: Visual question answering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:36.964984Z"},"links":{"citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:da26f587fc098e02fdf657766d949badce6918261fb0a12b36170bfb4135e29e","observation_id":"be9ea60a-6bb1-447f-9f50-bc46dd5b167e","resolution":{"observed_at":"2026-08-06T21:41:36.964984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T21:41:37.018974Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:37.018974Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:e75add6e80387fc10dfdcb324504a13aea1e34daaa5396c2513e5b6361f58a93","observation_id":"de0012f4-cfd3-446e-bb25-da7f0447338f","resolution":{"observed_at":"2026-08-06T21:41:37.018974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-02T21:55:15.857183Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-06T21:41:37.060542Z","title":"Are we on the right way for evaluating large vision-language models? arXiv preprint arXiv:2403.20330,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:37.060542Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:8720c206300e128ffe708709c0e09e63d304ec09734b74cda8b65aeb521f173d","observation_id":"f03e35c7-15c6-4412-a186-6ba364de3669","resolution":{"observed_at":"2026-08-06T21:41:37.060542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:37.107652Z","title":"R1-v: Reinforcing super generalization ability in vision- language models with less than $3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:37.107652Z"},"links":{"citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:7f210da7fa804cd62adbbf29effceea56c400db898a871beb5c666cadd7b1d51","observation_id":"36ffbdb7-f622-4f64-8ec5-c54f06370650","resolution":{"observed_at":"2026-08-06T21:41:37.107652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:44.325142Z","title":"M 3cot: A novel benchmark for multi- domain multi-step multi-modal chain-of-thought","venue":null,"work_id":"9e0cd726-287a-41d5-bae3-8bbb4e56de2f","year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:37.181858Z"},"links":{"citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:1bb8ecb356b544e63eed7c3615f4d0d8f53aa516ffd1bd881bcb5f4c1e09dd62","observation_id":"7730835c-196e-46e4-8e49-79513dffde51","resolution":{"observed_at":"2026-08-06T21:41:44.435523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:37.266368Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:37.266368Z"},"links":{"citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:d62b9c3ecb2f6d926d6920fdde8c7243caa4c5d330ffe549bdf1865bb2cd1351","observation_id":"2c7e9642-a714-4ae7-96d4-65bf223d4959","resolution":{"observed_at":"2026-08-06T21:41:37.266368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T21:41:37.363908Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:37.363908Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:1030d8ff76b5857751fc0376f51abc593638960eb5d00ea2fb690e8279f9a6c1","observation_id":"a59ed741-d1c7-4846-9d49-55986827a34e","resolution":{"observed_at":"2026-08-06T21:41:37.363908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:44.073141Z","title":"Mme: A compre- hensive evaluation benchmark for multimodal large language models, 2024","venue":null,"work_id":"61aa7056-b0cd-407b-8080-14b091023150","year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:37.416896Z"},"links":{"citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:9f1767d5e99b78a55f862c5dd4a2b3614632758b19573accf571cf3bda07770c","observation_id":"9ebdc35f-8e27-473e-997c-4698bd2eadc0","resolution":{"observed_at":"2026-08-06T21:41:44.182233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:43.855427Z","title":"Hallusionbench: an advanced diagnos- tic suite for entangled language hallucination and visual il- lusion in large vision-language models","venue":null,"work_id":"ac57449d-ad3e-486b-bbc1-c672f3bcb4ca","year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:37.474185Z"},"links":{"citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:9a545032275c4e8cc530306b92f5c83db10616cffcf8044c6ce8f379edd5b083","observation_id":"93ab7eea-85ef-4eb5-9497-ead8a6c49b62","resolution":{"observed_at":"2026-08-06T21:41:43.956530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T21:41:37.543852Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:37.543852Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:b75c85bbc066a11dabcd850e4af04433f94272fa82d409a1e3672ab1cf983c84","observation_id":"a9715380-7d87-4d83-986f-97ae974160d1","resolution":{"observed_at":"2026-08-06T21:41:37.543852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-06T21:41:37.636240Z","title":"Olympiadbench: A chal- lenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:37.636240Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:36ab05d83d2830d15ea400b18a78485feb229fee1cb9ed2bace6bd2ee7d9293e","observation_id":"77e758fd-1c0b-4b84-ad84-7a408c596d97","resolution":{"observed_at":"2026-08-06T21:41:37.636240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-07-06T20:49:27.466064Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-06T21:41:37.734988Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:37.734988Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:0db0ad43ef1ed1b4fbede70cfeb6bdb1f219363aa76b6f115253c28861906746","observation_id":"fb28a5cd-421c-445f-9007-ff80bac185c9","resolution":{"observed_at":"2026-08-06T21:41:37.734988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:37.820286Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:37.820286Z"},"links":{"citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:6b318295dcb8c910100d943bfe11cf3254a201a8eb8f3f22940586c5d2612b4b","observation_id":"5b0541e0-2129-48eb-9b5d-c0aaf865050a","resolution":{"observed_at":"2026-08-06T21:41:37.820286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T21:41:37.882424Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:37.882424Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:b8811dfa9a5d416510c5ad3ea8001ae5032861544b2cdf03d3ff9c2c0e258037","observation_id":"0a995200-d266-4af7-b4d1-4c749bb2f0a5","resolution":{"observed_at":"2026-08-06T21:41:37.882424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-06T21:41:37.947664Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:37.947664Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:c5d994c3307d1809ab74cb2edcc020e95826d0f3adcccebb397b309bf7868574","observation_id":"a1e9aacb-9249-43fa-a880-9ded340d290c","resolution":{"observed_at":"2026-08-06T21:41:37.947664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-06T21:41:38.034436Z","title":"Mme-cot: Benchmarking chain-of-thought in large multimodal models for reasoning quality, robustness, and efficiency","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:38.034436Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:20cff13e7cc293938b367ff577896b071fdffa10ef3c7c0a7f4228eff4338eab","observation_id":"6d2fc3ba-87a4-408e-b6d2-28629dc2b5da","resolution":{"observed_at":"2026-08-06T21:41:38.034436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T21:41:38.107966Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:38.107966Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:25ce338d3d8f50dc7f00281bcfabe43bf8fe1cbc8d12c9ca979532f064dac8ce","observation_id":"ce92bb88-2148-40fe-9df0-df9730d36ce9","resolution":{"observed_at":"2026-08-06T21:41:38.107966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-06T21:41:38.218393Z","title":"Evaluating object hallucina- tion in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:38.218393Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:02891d30fb57dfbea52ac2363436b1095c7c4f50bbe23c2c50f77a7688042cc0","observation_id":"e47b29ba-02f9-44ef-b388-744b0b1acbe1","resolution":{"observed_at":"2026-08-06T21:41:38.218393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17419","snapshot_observed_at":"2026-08-06T21:41:38.323087Z","title":"From system 1 to system 2: A survey of reasoning large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:38.323087Z"},"links":{"cited_paper":"/paper/2502.17419","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:4f5908808d35887504255fe91ea43a435904736fc61c89272c7efd7821c017f8","observation_id":"29fc1abd-5a76-480e-a5ca-aa060e71d691","resolution":{"observed_at":"2026-08-06T21:41:38.323087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T21:41:38.393410Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:38.393410Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:e20319289e886465403a86f34dd55f302edc3970bc240b21cd5f836d50251d8a","observation_id":"fc37b8db-903b-4034-bbb2-e83c62082ef2","resolution":{"observed_at":"2026-08-06T21:41:38.393410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03981","last_updated":"2025-05-06T21:08:27Z","snapshot_observed_at":"2026-08-01T16:00:12.263509Z","submitted_at":"2025-05-06T21:08:27Z","title":"X-Reasoner: Towards Generalizable Reasoning Across Modalities and Domains","version":1},"cited_work":{"arxiv_id":"2505.03981","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.03981","snapshot_observed_at":"2026-08-06T21:41:41.398168Z","title":"X-Reasoner: Towards Generalizable Reasoning Across Modalities and Domains","venue":"cs.AI","work_id":"ef433961-f4f8-4352-9989-4085b9609cb0","year":2025},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:38.463963Z"},"links":{"cited_paper":"/paper/2505.03981","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:c10e1df1c06faeee83b1edb03db82433972f61108763671b0129949675067702","observation_id":"c142dbff-ded5-415c-9b20-b7d4a1992ca8","resolution":{"observed_at":"2026-08-06T21:41:41.520575Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:43.562591Z","title":"Mmbench: Is your multi-modal model an all-around player? In European conference on computer vi- sion, pages 216–233","venue":null,"work_id":"3fee2f29-8424-45c0-a6e2-5ac902392f50","year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:38.513018Z"},"links":{"citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:8bd22980478be0a3c042947508fd4fd13cc11e632c3d3826ef0dba4c06871a09","observation_id":"0000f601-0756-4c2f-8a0f-7a2471a0e18f","resolution":{"observed_at":"2026-08-06T21:41:43.690894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-06T21:41:38.579018Z","title":"Mathvista: Evaluating mathemat- ical reasoning of foundation models in visual contexts.arXiv preprint arXiv:2310.02255, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:38.579018Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:8cbb5e90f414dec083a2cf31c7d20bba218d222d6e32f143b1ec2dbe0beee7e2","observation_id":"0e6e344c-68b5-455a-9592-b135010773f9","resolution":{"observed_at":"2026-08-06T21:41:38.579018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-06T21:41:38.631494Z","title":"Chartqa: A benchmark for question an- swering about charts with visual and logical reasoning.arXiv preprint arXiv:2203.10244, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:38.631494Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:99ce0243d16387866931594315bb53c098cdc12b1dcfb7792856b1c60b221fa7","observation_id":"cf81a703-ce5f-46bb-910c-e78427fd777b","resolution":{"observed_at":"2026-08-06T21:41:38.631494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:43.349794Z","title":"Visual cot: Advancing multi-modal language models with a com- prehensive dataset and benchmark for chain-of-thought rea- soning","venue":null,"work_id":"196ab40b-7f51-440a-a7fd-3f3c3ea4a492","year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:38.777914Z"},"links":{"citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:cf54d89b937ee65a61988d76d6dd2f766af89456215952e5d95d2c1e9059c0b6","observation_id":"5144df1c-c94b-4336-8a75-5c547156bb85","resolution":{"observed_at":"2026-08-06T21:41:43.452752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-06T21:41:38.843269Z","title":"Vlm-r1: A stable and generaliz- able r1-style large vision-language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:38.843269Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:5df02efd604754d56d73e56ed5d3aca9cc4e64ce07ad3dbdbb6102165ce84765","observation_id":"0f2f5a40-523a-4187-a9dd-eff88897d922","resolution":{"observed_at":"2026-08-06T21:41:38.843269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:43.033421Z","title":"Claude 3.7 sonnet, 2025","venue":null,"work_id":"c02db5af-1015-4f54-a2be-8520601df759","year":2025},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:38.930271Z"},"links":{"citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:782c790f65cc61b8f27fa37d18e4b549e426f0842d7e09fc771afc2e2252f17f","observation_id":"8f337445-6d0b-4852-9546-0e8596ac8d34","resolution":{"observed_at":"2026-08-06T21:41:43.186623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T21:41:39.038546Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of con- text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:39.038546Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:479bf2e9a24d77232bc87fcc2a7ff80a0b27a1bf0097f21dd26ca6137ba115ff","observation_id":"38f60056-f59a-4e94-941d-da25dc558f65","resolution":{"observed_at":"2026-08-06T21:41:39.038546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-06T21:41:39.192570Z","title":"Kimi k1.5: Scaling reinforcement learning with llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:39.192570Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:60b5a42449d25748420105ec252172122c86d849b08d6b05585696fcff53704e","observation_id":"864c0936-66c9-4841-a69e-43aa9db98b84","resolution":{"observed_at":"2026-08-06T21:41:39.192570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:42.777262Z","title":"Qvq: To see the world with wisdom, 2024","venue":null,"work_id":"f9d429b3-34d0-4a9f-a943-87d4abec64ea","year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:39.353962Z"},"links":{"citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:3e07080276e21150f9ff5324a64dc38b0c417146538972cd0ac6d8b3fee489dd","observation_id":"33880566-25cf-42b6-8ffc-4764fa08ec7b","resolution":{"observed_at":"2026-08-06T21:41:42.896929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:42.555745Z","title":"Qwq: Reflect deeply on the boundaries of the unknown, 2024","venue":null,"work_id":"13912baa-0b2e-4ef7-9af4-251de6559685","year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:39.503756Z"},"links":{"citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:b28e4767a09b7e9c027231dd48a32519d8aaf4da9fbaa0418efacf9e08c3ea66","observation_id":"b36a3b7a-3683-4148-9a7a-dd9fd47ab33c","resolution":{"observed_at":"2026-08-06T21:41:42.657113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-06T21:41:39.658744Z","title":"Enhancing the reason- ing ability of multimodal large language models via mixed preference optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:39.658744Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:e99d0f2de36e6dfe66dd3460facb340894d63700e9e01d80fb034a12d4a3870f","observation_id":"944a66d3-3182-42f5-bbbd-ff2df9985f9f","resolution":{"observed_at":"2026-08-06T21:41:39.658744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:42.323313Z","title":"Open-r1-video","venue":null,"work_id":"980df2fb-278b-4528-9723-0f4f53c342c0","year":2025},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:39.758478Z"},"links":{"citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:e890e4f97aa640a5388cbeab137486229f81f677cd5962ae018b997a0f6b3522","observation_id":"dc1e6874-59e1-4d60-ac44-28e7c5356027","resolution":{"observed_at":"2026-08-06T21:41:42.440908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09130","last_updated":"2025-04-12T08:37:30Z","snapshot_observed_at":"2026-08-02T20:43:09.064822Z","submitted_at":"2025-04-12T08:37:30Z","title":"VisuoThink: Empowering LVLM Reasoning with Multimodal Tree Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09130","snapshot_observed_at":"2026-08-06T21:41:39.855190Z","title":"Vi- suothink: Empowering lvlm reasoning with multimodal tree search","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:39.855190Z"},"links":{"cited_paper":"/paper/2504.09130","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:cfb98e4b37fe8228d8725382298f7782815004b52f8c2e2db7acc3ae72b0cc27","observation_id":"d176d38e-f478-4a60-859b-b22c4b999294","resolution":{"observed_at":"2026-08-06T21:41:39.855190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:42.154819Z","title":"Charxiv: Charting gaps in realistic chart understanding in multimodal llms","venue":null,"work_id":"e5f22810-bbd6-4f9f-aa2e-f3d49ebdde0d","year":2025},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:39.912917Z"},"links":{"citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:c8bb4035e4210151a9b3dfc21b557b98adb96b38f6b2a3a43a089c63f8c80932","observation_id":"d763cf7c-4589-4b5c-be57-5cf424486580","resolution":{"observed_at":"2026-08-06T21:41:42.215107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:39.982779Z","title":"Boosting mul- timodal reasoning with mcts-automated structured thinking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:39.982779Z"},"links":{"citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:4d9a67fc5912bc43e35100708d3cf0f7bc0bd3f74a2b138369c509b29fef37fc","observation_id":"1e22d933-8446-44f4-b425-e1ea0b1ed865","resolution":{"observed_at":"2026-08-06T21:41:39.982779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-06T21:41:40.067346Z","title":"Deepseek-vl2: Mixture-of- experts vision-language models for advanced multimodal understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:40.067346Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:6278417ad7e2a295008712bf7c248269ace07e1dd2c20b5c6cb29facbebc7ba4","observation_id":"47746207-6c7c-4ee6-8b2c-07e227d36c45","resolution":{"observed_at":"2026-08-06T21:41:40.067346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14768","last_updated":"2025-02-20T17:49:26Z","snapshot_observed_at":"2026-08-04T12:32:53.090165Z","submitted_at":"2025-02-20T17:49:26Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14768","snapshot_observed_at":"2026-08-06T21:41:40.126753Z","title":"Logic-rl: Unleashing llm reasoning with rule-based reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:40.126753Z"},"links":{"cited_paper":"/paper/2502.14768","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:a1c6e44c65ab3ac6318ec4eeb2e0c84f03be4c9adff672e4c4003e4b292b9428","observation_id":"58b2ef09-753d-40cc-9c41-ae15c01fabd7","resolution":{"observed_at":"2026-08-06T21:41:40.126753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-07-06T19:51:05.604758Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-06T21:41:40.221780Z","title":"Llava-o1: Let vision language models reason step- by-step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:40.221780Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:17ab63a202b80d1066dd8c23cd1dbfb72ac9b45df8bac7126365d5c5fa485eb0","observation_id":"ea48561d-de45-475c-a596-68d921cd0686","resolution":{"observed_at":"2026-08-06T21:41:40.221780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18319","last_updated":"2024-12-31T07:41:30Z","snapshot_observed_at":"2026-08-02T02:03:01.950155Z","submitted_at":"2024-12-24T10:07:51Z","title":"Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18319","snapshot_observed_at":"2026-08-06T21:41:40.304579Z","title":"Mulberry: Empowering mllm with o1-like reasoning and reflection via collective monte carlo tree search","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:40.304579Z"},"links":{"cited_paper":"/paper/2412.18319","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:b4c790b475ec51f7fff934e0f0321212f39dcadf32b17687eebef5a778fc2576","observation_id":"fec71ebb-790b-405a-aa09-33befdc3f34a","resolution":{"observed_at":"2026-08-06T21:41:40.304579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16673","last_updated":"2025-05-22T13:39:32Z","snapshot_observed_at":"2026-08-04T00:20:03.475564Z","submitted_at":"2025-05-22T13:39:32Z","title":"R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16673","snapshot_observed_at":"2026-08-06T21:41:40.361835Z","title":"R1-sharevl: Incentivizing reasoning capability of multimodal large language models via share-grpo","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:40.361835Z"},"links":{"cited_paper":"/paper/2505.16673","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:99fdfe14e4d856561116568c72b33b436ad003b5317cb996685f3397b4870143","observation_id":"2aacdaa0-ba2e-4fb9-901f-e0efd17ce28d","resolution":{"observed_at":"2026-08-06T21:41:40.361835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-06T21:41:40.429654Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:40.429654Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:ae891a77a87408e3efa9765991ea33795e8837880109240e278d886db0897f6a","observation_id":"3559689b-0da9-42f6-94d4-496b6fe9deb6","resolution":{"observed_at":"2026-08-06T21:41:40.429654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16006","last_updated":"2024-04-24T17:37:05Z","snapshot_observed_at":"2026-07-06T18:05:03.284784Z","submitted_at":"2024-04-24T17:37:05Z","title":"MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16006","snapshot_observed_at":"2026-08-06T21:41:40.493129Z","title":"Mmt-bench: A comprehensive multimodal bench- mark for evaluating large vision-language models towards multitask agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:40.493129Z"},"links":{"cited_paper":"/paper/2404.16006","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:9bc5d2af5e4d4fa89577dd2d4fed79b770159a084f7b5bb2b020e5252d33513d","observation_id":"9ea9b439-fd49-40a5-9db9-5e1f2a8f0b91","resolution":{"observed_at":"2026-08-06T21:41:40.493129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-06T13:03:19.727877Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-06T21:41:40.565270Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:40.565270Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:57eb2f52e6baedd74d7dab9027378ff3ce73931b1c3c6fc3a0439f5840fe1467","observation_id":"cf7dae34-fce7-45c6-bffe-2d2f5dfb778b","resolution":{"observed_at":"2026-08-06T21:41:40.565270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:41.983502Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for ex- pert agi","venue":null,"work_id":"bf7897e1-16ce-433b-890d-a4ef310badbf","year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:40.624530Z"},"links":{"citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:ee56d6a46acdd89ae506f592a47253e261321f620d797624c5834f690b3ef699","observation_id":"19eed217-3bfb-42ce-86d9-feddd144e924","resolution":{"observed_at":"2026-08-06T21:41:42.066729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-08-06T21:41:40.702164Z","title":"Mmmu-pro: A more robust multi- discipline multimodal understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:40.702164Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:154428d8f054478d01723c11be076e63038bfc47a1006cfccc142d60bad4aafd","observation_id":"4d8d3328-49e0-4ce5-b281-1c03ffe00383","resolution":{"observed_at":"2026-08-06T21:41:40.702164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20566","last_updated":"2024-09-30T17:59:34Z","snapshot_observed_at":"2026-08-05T16:49:53.377557Z","submitted_at":"2024-09-30T17:59:34Z","title":"MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20566","snapshot_observed_at":"2026-08-06T21:41:40.775733Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:40.775733Z"},"links":{"cited_paper":"/paper/2409.20566","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:5e450b446ae4ab9a21de45b1ef81a85a0f9b4e365216f8391a4924e2a3c42bf1","observation_id":"fe7fe619-ec37-48b2-b76d-529d226dc326","resolution":{"observed_at":"2026-08-06T21:41:40.775733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-06T21:34:54.534751Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-08-06T21:41:40.883389Z","title":"R1-vl: Learn- ing to reason with multimodal large language models via step-wise group relative policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:40.883389Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:b49e0dabaa11cc8e5f31143bc5900e88ce30ab4d9ed0d650b590b9051135af4b","observation_id":"ee42f373-7c73-4b4d-b7db-39c4af95d126","resolution":{"observed_at":"2026-08-06T21:41:40.883389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:41.759836Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? In European Conference on Computer Vision, pages 169–186","venue":null,"work_id":"da0c68d8-0d9b-4d41-9923-1f44275e0b9a","year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:40.941360Z"},"links":{"citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:3f2a597c54777ce693153136a4a5864d2e23171fb1a59c290593c9ec78d88cee","observation_id":"1fcd04ec-7e36-4357-9dbc-10dbab8f295e","resolution":{"observed_at":"2026-08-06T21:41:41.899167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16198","last_updated":"2024-10-21T17:00:06Z","snapshot_observed_at":"2026-07-06T19:37:16.203681Z","submitted_at":"2024-10-21T17:00:06Z","title":"Improve Vision Language Model Chain-of-thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16198","snapshot_observed_at":"2026-08-06T21:41:41.040789Z","title":"Improve vision language model chain-of- thought reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:41.040789Z"},"links":{"cited_paper":"/paper/2410.16198","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:27472d6c8fdfbef7e7e48cd8ee9b258fd7e7a950b9435fd8ea1bd879b56abcf5","observation_id":"9ca8fd4c-e733-4ed2-ab5d-dc3e9595b0a2","resolution":{"observed_at":"2026-08-06T21:41:41.040789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00836","last_updated":"2025-02-24T06:55:22Z","snapshot_observed_at":"2026-07-06T19:43:46.557944Z","submitted_at":"2024-10-29T17:29:19Z","title":"DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00836","snapshot_observed_at":"2026-08-06T21:41:41.103071Z","title":"Dynamath: A dynamic visual bench- mark for evaluating mathematical reasoning robustness of vision language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:41.103071Z"},"links":{"cited_paper":"/paper/2411.00836","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:ce1d9b78b2e9b06db62bef2e64eef43d7d0f6570f0d90b49f6243d226dd5a85a","observation_id":"68b418f4-f233-4f31-b187-9a27584609bf","resolution":{"observed_at":"2026-08-06T21:41:41.103071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T21:35:30.626662Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":1,"verified_fuzzy":12},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 3 inbound Pith citation observations for arXiv:2506.23563."}