{"as_of":"2026-08-06T20:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ab35e173f5e24c7a9bab1bf51ea5f0b39780aef03252991974c164e39764f8f7","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T13:33:12.508639Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.22746/citation-record","integrity":"/paper/2509.22746/integrity","json":"/paper/2509.22746/citation-record.json","paper":"/paper/2509.22746"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T00:05:48.311803Z","title":"write newline","venue":null,"work_id":"8e5fda61-e601-4df4-8204-015bee341570","year":null},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:5c8b65c344fc8038d348bce27fec36e0aa6c33b8c9c336b70d7284c5f8e78189","observation_id":"eae4980e-6bef-4e83-8138-d448e7efe1f3","resolution":{"observed_at":"2026-05-18T13:36:26.750252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:f9cc8eabf4ffcdc48d4556ae3e577cb1a8ff273783a21c6c6dc9da8747a43d63","observation_id":"c8ac538d-0065-4f3b-a0db-1d6e6af1e94c","resolution":{"observed_at":"2026-05-18T13:36:25.232148Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Graph of thoughts: Solving elaborate problems with large language models","venue":null,"work_id":"d3d5a2c4-727b-43a5-9be0-61f8aa55e256","year":2024},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:0f14dcdbe0a993e1ad0184d9437c2c0b44ca5a71a9b437264fd487114f1e6c63","observation_id":"17c759d6-33ce-4c0c-81a8-af07493f16c6","resolution":{"observed_at":"2026-05-18T13:36:26.743189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.20272","doi":"10.48550/arxiv.2505.20272","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ground- r1: Incentivizing grounded visual reasoning via reinforcement learning.arXiv preprint arXiv:2505.20272","venue":"arXiv (Cornell University)","work_id":"aa425e10-7c26-4b9a-888d-1a46143d06b2","year":2026},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:b02715f39c91175f79b138e22b05b54ab37cdf52068b419d5d93b6415881ebba","observation_id":"6d1a59b4-9003-4387-9eaa-8ccc8389a82b","resolution":{"observed_at":"2026-05-18T13:36:25.149784Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.11468","doi":"10.48550/arxiv.2504.11468","metadata_source":"pith","pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","venue":"cs.CL","work_id":"a521360c-8673-4d0d-a3a3-6eb9f7a71b90","year":2025},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:6a71d161159ee56a38fb469afd533a3713bfd11ed931a0c19141ec3adf6ac7be","observation_id":"d4b59fc0-9878-4ddd-876b-91f6ccbf08e0","resolution":{"observed_at":"2026-05-18T13:36:25.155140Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":"2306.15195","doi":"10.48550/arxiv.2306.15195","metadata_source":"pith","pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","venue":"cs.CV","work_id":"44525076-312a-4259-b79c-134cd7eeb297","year":2023},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:189af0400aa51b17ce9fb264f702d67ff31f1071348b2fd2cd041c638ac30043","observation_id":"f194457a-7a47-4c76-b4ce-a86eb070ed54","resolution":{"observed_at":"2026-05-18T13:36:25.302737Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Are we on the right way for evaluating large vision-language models? Advances in Neural Information Processing Systems, 37: 0 27056--27087, 2024 a","venue":null,"work_id":"2460e116-c59b-4adc-aed8-db912b92c3dc","year":2024},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:0e0e8b4464dfeb44a80dbd2e3a654ac1460b2fee8903e29c4ed35bae640e95f8","observation_id":"6ef69faa-0bc5-496b-8918-bf34aa4904a2","resolution":{"observed_at":"2026-05-18T13:36:26.739617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":"0e3f699a-05c0-42a7-a545-97d8f542799f","year":2024},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:30d6897825b481316b099fe3647a0ea7aed22c2ead41189441195d6c5ae245af","observation_id":"e43bead3-ca1c-4d9d-9253-4a27eda87d19","resolution":{"observed_at":"2026-05-18T13:42:39.682307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:c4f05ac11595326432e965eb764505ed7fb8792cee2106bbb8b4fb2531f2b61e","observation_id":"3e86c49b-ab93-4d7c-8b77-484c4265308e","resolution":{"observed_at":"2026-05-18T13:36:25.236412Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Insight-v: Exploring long-chain visual reasoning with multimodal large language models","venue":null,"work_id":"2b68a2dc-004f-4a4f-bc51-59433c56b087","year":2025},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:5f674d238cdce4353130a840b6b1d0587ff464688b0365e74116a9b9d36f3ac1","observation_id":"8bbbb5f5-c80c-480a-8c5d-981d46d98f93","resolution":{"observed_at":"2026-05-18T13:36:26.746641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01904","last_updated":"2025-02-05T09:17:01Z","snapshot_observed_at":"2026-07-06T20:16:18.023949Z","submitted_at":"2025-01-03T17:14:16Z","title":"Virgo: A Preliminary Exploration on Reproducing o1-like MLLM","version":2},"cited_work":{"arxiv_id":"2501.01904","doi":"10.48550/arxiv.2501.01904","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01904","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Virgo: A preliminary exploration on reproducing o1-like mllm","venue":"arXiv (Cornell University)","work_id":"46f1ca0b-4c93-45d2-aeb6-e14eeefec8a9","year":2025},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2501.01904","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:17790fdcbe29ae6211473d8236e8cf183b906cf08331b051234ca6317ffff0a5","observation_id":"d21b6467-f76a-4848-8bce-95109d40f558","resolution":{"observed_at":"2026-05-18T13:36:25.184297Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15879","last_updated":"2026-05-09T18:01:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:54:49Z","title":"GRIT: Teaching MLLMs to Think with Images","version":2},"cited_work":{"arxiv_id":"2505.15879","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15879","snapshot_observed_at":"2026-07-11T03:17:51.507547Z","title":"GRIT: Teaching MLLMs to Think with Images","venue":"cs.CV","work_id":"0a45eb3d-cd3b-4535-9626-ac689cfff7e1","year":2025},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2505.15879","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:393cac3f13a0443a3d50ddd3bc979b571d7bc45d772b42511be3340befe0c1aa","observation_id":"9c9dc810-3210-4559-aafd-a0dafc2aa787","resolution":{"observed_at":"2026-05-18T13:36:25.109996Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"G-llava: Solving geometric problem with multi-modal large language model","venue":null,"work_id":"b5a77a95-f56d-43e6-abe4-d7ce797eba26","year":2023},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:24ed4e6f9cc718403326a0bd6d1d0497a44c1759c97394f3684fa350c162a46a","observation_id":"3f8f19ae-d2cf-40d4-ab00-d60404a94583","resolution":{"observed_at":"2026-05-18T13:36:26.730466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-07-06T20:49:27.466064Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":"2503.06749","doi":"10.48550/arxiv.2503.06749","metadata_source":"pith","pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","venue":"cs.CV","work_id":"38998646-34ee-4605-b661-ab356f16d6e5","year":2025},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:324f44f3a831675969d047275792d0f8b8c819bfcc9f49e36df309c214a38468","observation_id":"0aed07cb-5226-4026-b352-fb2322e0c3bb","resolution":{"observed_at":"2026-05-18T13:36:25.213344Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:3ebd5dd493827989289a4af7c34ef1b17b1936aa390ac81573f3b0641fafcb22","observation_id":"7fa6fbd7-27a6-4211-ae90-4efd5d9c972e","resolution":{"observed_at":"2026-05-18T13:36:25.105758Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":"2501.12599","doi":"10.48550/arxiv.2501.12599","metadata_source":"pith","pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","venue":"cs.AI","work_id":"bff96ab1-bd6a-4585-be23-74fdb51969c7","year":2025},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:66fcb3622d13b7b73a800285ce672cb644575d95b7e5fae30e3154e3b6da0b58","observation_id":"e46a6aa9-4bfd-4f67-82dd-d0f155e4dc36","resolution":{"observed_at":"2026-05-18T13:36:25.170186Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T00:05:48.313381Z","title":"Large language models are zero-shot reasoners","venue":null,"work_id":"d4bd155e-4771-4421-89e1-851500eaaea7","year":2022},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:a00616aab384b3482873be42c391e345a06969cc15b0346f6df441abcbfcc3c4","observation_id":"8973cd9b-1d6a-4b9c-b762-eb876efbe796","resolution":{"observed_at":"2026-05-18T13:36:26.723765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hypertree proof search for neural theorem proving","venue":null,"work_id":"8e4c3b01-56ac-476d-a417-45ee9e55b53e","year":2022},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:fc97467e347166fdd338f0c2637af8289aaf375674ceb1cc196ee2b5bd646b4b","observation_id":"bb16ecd9-18b3-442d-aff4-02166106f159","resolution":{"observed_at":"2026-05-18T13:36:26.727128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaffolding coordinates to promote vision-language coordination in large multi-modal models","venue":null,"work_id":"a8c7c22d-4b3a-48d6-97b4-0d01f0d666d2","year":2024},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:1774e3be4f4f6fc9196290d3816beb427bc05ebf14a92239ea0c6b58421b9804","observation_id":"596e9e5d-faa1-4a5c-8635-1f1fdec22f2d","resolution":{"observed_at":"2026-05-18T13:36:26.736572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:c853fee65d95805ebd7b023b1f5e40622193ea14a73067406c5f26a32f1ff205","observation_id":"e21b9d30-ad94-4c8a-89a7-2b52dcf8ce34","resolution":{"observed_at":"2026-05-18T13:36:25.193876Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Numinamath","venue":null,"work_id":"724f63b7-320c-4b65-bcb4-824f78bfa2ef","year":2024},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:9cda3012e69771cd288cc8d70a349af15f5de3c7c0850433e222c39b8254aa72","observation_id":"6dd36938-4398-4374-b00a-c05e0a2b47a0","resolution":{"observed_at":"2026-05-18T13:36:26.733370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2305.10355","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-07-10T11:37:03.198858Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","venue":"cs.CV","work_id":"66d8ac3e-c134-4995-b528-550afa17586f","year":2023},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:772d83b66346344f2ef868078527dfa331c0552570e27212a11d67762d9993c7","observation_id":"6d9d66cb-4387-4d7b-ba27-34cfb4bc259c","resolution":{"observed_at":"2026-05-18T13:36:25.174850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16919","last_updated":"2025-03-08T17:16:09Z","snapshot_observed_at":"2026-07-06T18:20:22.759333Z","submitted_at":"2024-05-27T08:12:00Z","title":"VoCoT: Unleashing Visually Grounded Multi-Step Reasoning in Large Multi-Modal Models","version":3},"cited_work":{"arxiv_id":"2405.16919","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.16919","snapshot_observed_at":"2026-07-04T15:09:55.106687Z","title":"V ocot: Unleashing visually grounded multi-step reasoning in large multi-modal models","venue":null,"work_id":"e45af79d-e705-42bd-ada7-7d63ff1ace50","year":2024},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2405.16919","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:420f349fb9c11d226765fcf2b4fb18ff1f774b87c94889c7038ba4cba9737ec0","observation_id":"494333cc-0eec-4838-ba19-b8d7b4637278","resolution":{"observed_at":"2026-05-18T13:36:25.203478Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2503.01785","doi":"10.48550/arxiv.2503.01785","metadata_source":"pith","pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-07-11T03:17:51.789600Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"872f09b5-998d-4a66-9a2f-f7ec2407cd62","year":2025},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:feb310890e55276f04c15aaa075d6b9c4fc91337f589b1b2010fa5f6034e65d9","observation_id":"55ab3a8a-ffba-4052-b05a-8e2206cdbf30","resolution":{"observed_at":"2026-05-18T13:36:25.298265Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":"2310.02255","doi":"10.1109/cvpr52734.2025.01245","metadata_source":"pith","pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","venue":"cs.CV","work_id":"e22c3789-9e71-4242-b6ea-3e60e06e2b66","year":2023},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:26dd72ab1f4002f0861ca0401d27a9baaaf7e7868d36b829f88dda2a12a2e0c9","observation_id":"86a720e7-bcee-4441-a8da-013578a46e74","resolution":{"observed_at":"2026-05-18T13:36:25.143460Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18129","last_updated":"2026-04-16T06:56:57Z","snapshot_observed_at":"2026-07-06T21:29:26.614513Z","submitted_at":"2025-05-23T17:41:14Z","title":"One RL to See Them All: Visual Triple Unified Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.18129","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18129","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"One RL to See Them All: Visual Triple Unified Reinforcement Learning","venue":"cs.CV","work_id":"a6ef804b-0440-48f6-8877-81523ce7a7ec","year":2025},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2505.18129","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:89e943cee3c7eff9aa5f3b9275c395960de413fc2c9d18e7edbf799e0d7457d3","observation_id":"489fd87b-cca6-4c56-a5fd-ae0c8460da40","resolution":{"observed_at":"2026-05-18T13:36:25.286858Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T05:30:43.748529Z","title":"Self-refine: Iterative refinement with self-feedback","venue":null,"work_id":"b3ae5b17-843e-4d75-8382-39bd9e41231d","year":2023},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:f3222ed32dd77dfaf33fda93fcbd2d1721ba05d65c06384d266ff2e74c6c46d0","observation_id":"eadc6229-3e3b-4bc8-923f-6196c9449831","resolution":{"observed_at":"2026-05-18T13:42:39.671092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-07-06T20:49:56.018809Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.07365","doi":"10.48550/arxiv.2503.07365","metadata_source":"pith","pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","venue":"cs.CV","work_id":"eda3a54e-ebd6-40bd-af17-b567ea4c5d62","year":2025},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:7ff0d53e9d98987e3957f3e48d8e4ec8b5eac3d9466702993d9a3fb635fed82d","observation_id":"9f1c250c-57b9-4e58-8e2c-4a66ec98a420","resolution":{"observed_at":"2026-05-18T13:36:25.130294Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Compositional chain-of-thought prompting for large multimodal models","venue":null,"work_id":"add06130-cc40-4ada-85f5-1d677482f36a","year":2024},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:f91b05a33fa75d97665f4180ccbacb0c2d7bcd7c5b3d9ead116f1c7fd7cc4a60","observation_id":"613234ac-408c-4fae-919e-eb474ca6ee8f","resolution":{"observed_at":"2026-05-18T13:42:39.663341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Omnicount: Multi-label object counting with semantic-geometric priors","venue":null,"work_id":"223b990f-44ba-4668-babf-cde6fae05173","year":2025},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:da8e89ad729bd69098b4d2472632bce516881d174db1eb3690bfdc85dedbcaa1","observation_id":"f9f65693-3908-4838-91d7-c64f85198f84","resolution":{"observed_at":"2026-05-18T13:42:39.656261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Thinking with images","venue":null,"work_id":"d01b9d1a-cb1a-47e2-99a4-f1c29692e48f","year":2025},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:48f8f285a4e4485a7d022874d5fb45369a6aa7feee4cc3dbdb9cd562d20975c9","observation_id":"671b24a3-b707-41dc-bda2-00e89fc29b94","resolution":{"observed_at":"2026-05-18T13:42:39.667756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07536","last_updated":"2025-03-11T03:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-10T17:04:14Z","title":"LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL","version":2},"cited_work":{"arxiv_id":"2503.07536","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.07536","snapshot_observed_at":"2026-07-04T10:39:45.355868Z","title":"LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL","venue":"cs.CL","work_id":"30c18d3e-432d-404b-9572-1c7375bee8ed","year":2025},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2503.07536","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:0342d982e63ee254e38867656c872442cb88d82f380f024f16e7794fabb11134","observation_id":"54bc6d70-db0e-4b97-9749-2feecf785e46","resolution":{"observed_at":"2026-05-18T13:36:25.114501Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01284","last_updated":"2024-07-01T13:39:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-01T13:39:08Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","version":1},"cited_work":{"arxiv_id":"2407.01284","doi":"10.48550/arxiv.2407.01284","metadata_source":"pith","pith_arxiv_id":"2407.01284","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","venue":"cs.AI","work_id":"36b1b11c-2612-4d1d-9a6e-7db18eca4a25","year":2024},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2407.01284","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:b65688800e50358857b08c7560fad6d1cf2a59705997fdbb0deb354bdd721bb5","observation_id":"c6303bcc-b9d2-4b01-a448-de45481f3088","resolution":{"observed_at":"2026-05-18T13:36:25.124560Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"QwQ-32B : Embracing the power of reinforcement learning, March 2025","venue":null,"work_id":"5e379cfc-a81d-4e5a-8b55-3c482f6be50f","year":2025},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:146527ae2097505dbb352d3470381f8fd575d9994fa0ba2ac4af0e37bf4e0073","observation_id":"0e8882d0-2c75-484b-93d9-0e90df5dc9bd","resolution":{"observed_at":"2026-05-18T13:42:39.674868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23678","last_updated":"2026-05-15T17:27:46Z","snapshot_observed_at":"2026-08-02T04:30:21.704758Z","submitted_at":"2025-05-29T17:20:26Z","title":"Grounded Reinforcement Learning for Visual Reasoning","version":3},"cited_work":{"arxiv_id":"2505.23678","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23678","snapshot_observed_at":"2026-07-04T19:20:07.271783Z","title":"Grounded Reinforcement Learning for Visual Reasoning","venue":"cs.CV","work_id":"e7be54cd-0b00-4d24-b74f-56621ab7acd4","year":2025},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2505.23678","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:464a36021ebcd401e5d9bab93a54c404d99d5493cbbf65de19d160ced75022c2","observation_id":"eb758a0e-2145-4ff9-afca-dceab286a150","resolution":{"observed_at":"2026-05-18T13:36:25.189444Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16999","last_updated":"2024-11-04T05:50:56Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:59:23Z","title":"Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":"2403.16999","doi":"10.48550/arxiv.2403.16999","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.16999","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual cot: Advancing multi-modal language models with a comprehensive dataset and benchmark for chain-of-thought reasoning, 2024a","venue":"arXiv (Cornell University)","work_id":"da440264-f4bb-477b-b4a4-c14bab386f8f","year":2024},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2403.16999","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:95f318749cfc3d58b6563789a232803027e11eeb31504d3c8dcf53212e8463b6","observation_id":"2aa5a4b8-039d-4a8d-936d-578fd348553f","resolution":{"observed_at":"2026-05-18T13:36:25.165701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:7ce3b42155391ff62fdec10d841f05881352415a58467c5fc15f777d2bd6d681","observation_id":"d55c139d-dd28-4bd1-965c-94d5930f9d24","resolution":{"observed_at":"2026-05-18T13:36:25.198881Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16044","last_updated":"2025-09-01T02:39:51Z","snapshot_observed_at":"2026-07-06T19:56:17.117739Z","submitted_at":"2024-11-25T02:15:30Z","title":"ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image Exploration","version":4},"cited_work":{"arxiv_id":"2411.16044","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.16044","snapshot_observed_at":"2026-07-04T15:09:55.313006Z","title":"Zoomeye: Enhancing multimodal llms with human-like zooming capabilities through tree-based image exploration.arXiv preprint arXiv:2411.16044","venue":null,"work_id":"441886d1-6432-4fdf-b8f6-c3463a0b4bf6","year":2024},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2411.16044","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:24b2f082a2794c04c5a631c78c2191a6850f5e25d54c09fef117d3b21340ed69","observation_id":"6b4bfc76-4bee-4a75-ac32-64f54fd4d0b2","resolution":{"observed_at":"2026-05-18T13:36:25.241161Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T05:30:43.738754Z","title":"Reflexion: Language agents with verbal reinforcement learning","venue":null,"work_id":"4d8fa254-7bc5-4805-9176-fa1f8e16e7f4","year":2023},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:44cf4f02806ca87aaa1a2ff8ecd2dd3a163bedf6b5d6b219c2ecf8ae8b90a0ef","observation_id":"df381330-8b9c-4ad3-9593-fbc176df5458","resolution":{"observed_at":"2026-05-18T13:42:39.678876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06186","last_updated":"2025-01-10T18:59:51Z","snapshot_observed_at":"2026-07-06T20:19:26.003822Z","submitted_at":"2025-01-10T18:59:51Z","title":"LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":"2501.06186","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06186","snapshot_observed_at":"2026-07-03T20:08:55.654788Z","title":"org/abs/2501.06186","venue":null,"work_id":"6543daed-6f88-41e0-a9d5-7bfc9e75ccee","year":2025},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2501.06186","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:0e4988e8f4248652b2cece50598777016c3a3bc9f7ed31b1acb64031d572616b","observation_id":"848dac7b-ef8a-4f42-a83e-ab8cb60f7440","resolution":{"observed_at":"2026-05-18T13:36:25.179472Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Toward self-improvement of llms via imagination, searching, and criticizing","venue":null,"work_id":"691a2895-7a7a-4d18-8e31-14250539aa4b","year":2024},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:579efe90366ba08bfeab9947af5b3676acc62af70987546ddade4f0858a89173","observation_id":"34c7873a-49d0-4992-aa6d-4e9c1cc6747c","resolution":{"observed_at":"2026-05-18T13:36:26.772917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14804","last_updated":"2024-02-22T18:56:38Z","snapshot_observed_at":"2026-08-06T04:41:26.667478Z","submitted_at":"2024-02-22T18:56:38Z","title":"Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset","version":1},"cited_work":{"arxiv_id":"2402.14804","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.14804","snapshot_observed_at":"2026-07-03T20:48:56.151594Z","title":"Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset","venue":"cs.CV","work_id":"c59c0707-68e6-4ab4-9b9f-293004398dc7","year":2024},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2402.14804","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:9c8ef94d8079b9376e0a565b80693c72558e6fc900177db0e4ae32c63dca1b2d","observation_id":"96f4f656-afad-4a21-94d7-8d4589147942","resolution":{"observed_at":"2026-05-18T13:36:25.223356Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":"854c612c-6f04-4a37-bd92-585ff4db18c2","year":2023},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:8188373edbbfd2965fac5ea8e6ea1152b9255e2b4dd8571afc1120199d6a18e7","observation_id":"58d32fa8-b084-48b7-a943-96adcba97d2a","resolution":{"observed_at":"2026-05-18T13:36:26.764897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T00:05:48.316851Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":"d60ac220-ba9f-4390-a464-86365224c428","year":2022},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:d13b534f12f78ead5f62b0009a4b4ac7bcb02206ac49ea98212899843dafb5e4","observation_id":"567823d3-0618-4525-af76-ca165c7c2c7a","resolution":{"observed_at":"2026-05-18T13:36:26.769023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.05255","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T15:09:54.903577Z","title":"Open vision reasoner: Transferring linguistic cognitive behavior for visual reasoning","venue":null,"work_id":"133cbd5e-1179-4fe7-ad47-1c75d513d025","year":2025},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:ce5a07444912133437439ebe1275200e4bbf6ec41833cacb2ccc430b136e06a3","observation_id":"0706187b-201c-4eee-8fa5-6dc413ea7157","resolution":{"observed_at":"2026-05-18T13:36:25.136959Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17012","last_updated":"2026-04-13T12:33:41Z","snapshot_observed_at":"2026-07-06T21:28:43.610849Z","submitted_at":"2025-05-22T17:59:03Z","title":"SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence","version":3},"cited_work":{"arxiv_id":"2505.17012","doi":"10.48550/arxiv.2505.17012","metadata_source":"pith","pith_arxiv_id":"2505.17012","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence","venue":"cs.CV","work_id":"7fe32ac0-2fff-4a5e-958f-28092c0ee055","year":2025},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2505.17012","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:b2efa508fd1b12ada4872f657a1332d8299075181d4c373a6869284729d3761b","observation_id":"f669f1a8-8023-4c2a-8d36-def6a0b6de81","resolution":{"observed_at":"2026-05-18T13:36:25.264926Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-04T14:26:27.153017Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:001232aabd667d2cccdd01ad743b4b4d2a3b17f3e6e772775642d438fb75c513","observation_id":"e64e0d55-fe91-403e-8dc5-24610c1afd0b","resolution":{"observed_at":"2026-05-18T13:36:25.246023Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12799","last_updated":"2025-03-24T11:30:58Z","snapshot_observed_at":"2026-07-06T20:53:41.124209Z","submitted_at":"2025-03-17T04:07:47Z","title":"Grounded Chain-of-Thought for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2503.12799","doi":"10.48550/arxiv.2503.12799","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12799","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grounded chain-of-thought for multimodal large language models","venue":"arXiv (Cornell University)","work_id":"7c96eee6-9ba4-4372-923a-2cb1fcd44797","year":2025},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2503.12799","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:510b107fcb7c7f49bd0d09ec3fde806bfa33980bfa56bf274288d0c82df52277","observation_id":"17b940df-2077-4fa0-ac82-5b632675a6f1","resolution":{"observed_at":"2026-05-18T13:36:25.208637Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-evaluation guided beam search for reasoning","venue":null,"work_id":"e75ae964-8c5d-4e5f-9dea-9d18b63b2b42","year":2023},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:075c18e3da85d86c71d74ae115f6c2a6a3cc4f01549f604df897d9df5e67d18d","observation_id":"09915245-a471-48c9-899f-0195c2f18fa8","resolution":{"observed_at":"2026-05-18T13:36:26.776685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-07-06T19:51:05.604758Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":"2411.10440","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-07-04T16:59:58.575310Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","venue":"cs.CV","work_id":"a650e873-dbbf-4963-af68-3896dcd4975b","year":2024},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:b91a5000093eae30cfcdefebfae7e1e5619c2e00ee904f21fcbb6c0e5248a7f8","observation_id":"ef47cf23-1767-48a0-8c37-d3d5bfeceadf","resolution":{"observed_at":"2026-05-18T13:36:25.280777Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12597","last_updated":"2025-04-24T02:21:05Z","snapshot_observed_at":"2026-07-06T21:10:41.390098Z","submitted_at":"2025-04-17T02:46:27Z","title":"GeoSense: Evaluating Identification and Application of Geometric Principles in Multimodal Reasoning","version":2},"cited_work":{"arxiv_id":"2504.12597","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.12597","snapshot_observed_at":"2026-07-01T13:25:45.137223Z","title":"GeoSense: Evaluating identification and application of geometric principles in multimodal reasoning","venue":null,"work_id":"677806a3-ca3b-4b7c-a1e9-b81c6019bc73","year":2025},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2504.12597","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:acb0d952cd11fdd01af43d58d05be5bcd8e4ef033a773313c2b6c5016ee53770","observation_id":"c2ff1905-bcb4-4ad8-b597-6d20402c7b01","resolution":{"observed_at":"2026-05-18T13:36:25.255208Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Set-of-mark prompting unleashes extraordinary visual grounding in gpt-4v","venue":null,"work_id":"7d40c1e2-d8d3-49d4-9476-8e412b53df97","year":2023},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:fe39f27cbc038fd15891812ed0fafd9d18ff07d4aee532b26df01c6698f9e648","observation_id":"d0084653-492f-4f57-86f7-7dbd5c26c31e","resolution":{"observed_at":"2026-05-18T13:36:26.761087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-07-06T20:52:09.743730Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":"2503.10615","doi":"10.48550/arxiv.2503.10615","metadata_source":"pith","pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","venue":"cs.CV","work_id":"bd2bf4d0-20bf-49b8-8dac-b54a8019be6c","year":2025},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:425eaee01617c31b0c2a922194dafb146738605f64a437f1e441ef91227a6195","observation_id":"ada1b670-4925-4ab9-8335-318ae0fea32d","resolution":{"observed_at":"2026-05-18T13:36:25.260535Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18319","last_updated":"2024-12-31T07:41:30Z","snapshot_observed_at":"2026-08-02T02:03:01.950155Z","submitted_at":"2024-12-24T10:07:51Z","title":"Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search","version":2},"cited_work":{"arxiv_id":"2412.18319","doi":"10.48550/arxiv.2412.18319","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.18319","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mulberry: Empowering mllm with o1-like reasoning and reflection via collective monte carlo tree search","venue":"arXiv (Cornell University)","work_id":"75422e11-539a-4a97-b9e7-b01a293d3876","year":2024},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2412.18319","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:430a99f80a519f7895f0d9747534ce238d7c7751d30b75caf6a3603e723cdfd2","observation_id":"1901e20f-0587-4281-904a-fc08c4dbeab0","resolution":{"observed_at":"2026-05-18T13:36:25.218707Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tree of thoughts: Deliberate problem solving with large language models","venue":null,"work_id":"010045f5-6a52-43e6-9cf2-5850ec0adbf9","year":2024},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:3bd7531107704dcf5dcf692ca0bda5a6be1a53e8eeb1656c666e4a9093ee4e31","observation_id":"b1cb55ff-7440-413f-84dc-0803f795c833","resolution":{"observed_at":"2026-05-18T13:36:26.757761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:071f11d3ed25eb0d4cf754559b83e454bdb68663fbea1c0ef208405c0af46e42","observation_id":"c9be5a1e-b53a-4b62-b4db-e4ca1eede66e","resolution":{"observed_at":"2026-05-18T13:36:25.307894Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14624","last_updated":"2024-08-18T08:10:16Z","snapshot_observed_at":"2026-08-04T04:40:00.850270Z","submitted_at":"2024-03-21T17:59:50Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","version":2},"cited_work":{"arxiv_id":"2403.14624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.14624","snapshot_observed_at":"2026-07-03T20:48:56.007587Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","venue":"cs.CV","work_id":"5ac1378a-eb29-4156-b54f-ca50bf47e594","year":2024},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2403.14624","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:f1c8a35895371694e75bede4a3064579e3743c7b2045ee07b2d27afe56b7f416","observation_id":"64f8fb67-8516-4565-a997-430f917769b6","resolution":{"observed_at":"2026-05-18T13:36:25.269615Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16198","last_updated":"2024-10-21T17:00:06Z","snapshot_observed_at":"2026-07-06T19:37:16.203681Z","submitted_at":"2024-10-21T17:00:06Z","title":"Improve Vision Language Model Chain-of-thought Reasoning","version":1},"cited_work":{"arxiv_id":"2410.16198","doi":"10.48550/arxiv.2410.16198","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.16198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Math- verse: Does your multi-modal llm truly see the diagrams in visual math problems? InEuropean Conference on Computer Vision, pp","venue":"arXiv (Cornell University)","work_id":"d845f05a-594c-4588-ba96-fb4b96773d84","year":2024},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2410.16198","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:4a74ef44985927822278367de6f5f6d38647b1464cdec0ef2076c1fa085a0e43","observation_id":"1c72cbf4-188f-4bfd-9167-af8f49785e6a","resolution":{"observed_at":"2026-05-18T13:36:25.275632Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15436","last_updated":"2025-12-05T05:44:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T12:18:15Z","title":"Adaptive Chain-of-Focus Reasoning via Dynamic Visual Search and Zooming for Efficient VLMs","version":3},"cited_work":{"arxiv_id":"2505.15436","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15436","snapshot_observed_at":"2026-07-08T23:55:43.041447Z","title":"Adaptive Chain-of-Focus Reasoning via Dynamic Visual Search and Zooming for Efficient VLMs","venue":"cs.CV","work_id":"c157db40-f1a3-4bf3-b004-55183727b771","year":2025},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2505.15436","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:63fde3b096e97043eb49d47850abad3c55a6e1a90fd7c249bc9041e69f72d039","observation_id":"b35e14bb-6c22-4050-877b-00556a8a467d","resolution":{"observed_at":"2026-05-18T13:36:25.119251Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14362","last_updated":"2026-03-01T04:59:56Z","snapshot_observed_at":"2026-08-02T12:23:34.946873Z","submitted_at":"2025-05-20T13:48:11Z","title":"DeepEyes: Incentivizing \"Thinking with Images\" via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.14362","doi":"10.48550/arxiv.2505.14362","metadata_source":"pith","pith_arxiv_id":"2505.14362","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepEyes: Incentivizing \"Thinking with Images\" via Reinforcement Learning","venue":"cs.CV","work_id":"5f6cf57b-2407-4127-b39c-d8a61494e474","year":2025},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2505.14362","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:b206d10c1b236784046152f654b0eea3d4946746eff4cb720c844cb4b44e8507","observation_id":"e14bc0e6-da42-4368-9d66-5d4696bbf492","resolution":{"observed_at":"2026-05-18T13:36:25.292168Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13872","last_updated":"2024-05-29T02:24:36Z","snapshot_observed_at":"2026-08-03T12:37:51.928616Z","submitted_at":"2024-05-22T17:56:51Z","title":"Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2405.13872","doi":"10.48550/arxiv.2405.13872","metadata_source":"pith","pith_arxiv_id":"2405.13872","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Image-of- thought prompting for visual reasoning refinement in multimodal large language models","venue":"cs.AI","work_id":"b297e4fe-c03f-49c9-896a-2d505bdf26ce","year":2024},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2405.13872","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:ea4bb9a6397d1183ae7ff18ac4533be3128805619126da80416b97862386ed40","observation_id":"0cf59d23-0df2-4584-a084-056771c44046","resolution":{"observed_at":"2026-05-18T13:36:25.228065Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:2a499daefadfb28f23b5f5e16ac23937d8711b44c880ee24141f2e27950c736a","observation_id":"f714d8db-b659-4c1e-b422-80eb5910e66a","resolution":{"observed_at":"2026-05-18T13:36:25.250615Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T23:55:44.012295Z","title":"@esa (Ref","venue":null,"work_id":"b058608d-98d0-4821-a4ae-403d2b7cd411","year":null},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:f1fe075fc63c2d3e3840524b33cd96aab8e38e30fb6bd14c9a01a4f4abdb9702","observation_id":"fe667d02-bb25-4f8e-b3e8-a8bef73ff84b","resolution":{"observed_at":"2026-05-18T13:42:39.652566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T00:05:48.337191Z","title":null,"venue":null,"work_id":"ea79bfb8-d434-45e9-8607-416d3839ec5c","year":null},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:9730484fd95d61f6778025ff9a9327826b08c7212b66e53dfa319ff69796e5a6","observation_id":"3acfbb19-209a-46af-ba66-2e891a7e98ee","resolution":{"observed_at":"2026-05-18T13:36:26.754015Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"tables/0000775","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T00:24:04.134893Z","title":"(QGT+  o/߸ ;fQ Zt鐒gvZxG*J Y ȮY! dZs (HE E 2 n=#R","venue":null,"work_id":"89321300-2925-4a31-ae58-cb928433b79a","year":2003},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:492178ef88a1f75974424484dae3f0fc126896421e7c85795fe9b8d467aefaeb","observation_id":"dddb4ee2-b4b7-4bc8-b4bf-9f7c464dc0d2","resolution":{"observed_at":"2026-05-18T13:36:25.160912Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-31T03:14:47.894025Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":1,"verified_exact":38,"verified_fuzzy":23},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 0 inbound Pith citation observations for arXiv:2509.22746."}