{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:7VKRI222TJJCWPSLZEIAQDZBVB","short_pith_number":"pith:7VKRI222","schema_version":"1.0","canonical_sha256":"fd55146b5a9a522b3e4bc910080f21a879bd90d4eb0a05390cf8a57d03ff75d0","source":{"kind":"arxiv","id":"2506.01078","version":1},"attestation_state":"computed","paper":{"title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CV","authors_text":"Can Zhang, Jinqiao Wang, Minghui Qiu, Ming Tang, Rongkun Xue, Ruipu Luo, Yifan Li, Yousong Zhu, Yufei Zhan, Zheming Yang, Zhenghao Chen, Zhentao He, Ziheng Wu","submitted_at":"2025-06-01T16:28:26Z","abstract_excerpt":"Despite notable advancements in multimodal reasoning, leading Multimodal Large Language Models (MLLMs) still underperform on vision-centric multimodal reasoning tasks in general scenarios. This shortfall stems from their predominant reliance on logic- and knowledge-based slow thinking strategies, while effective for domains like math and science, fail to integrate visual information effectively during reasoning. Consequently, these models often fail to adequately ground visual cues, resulting in suboptimal performance in tasks that require multiple plausible visual interpretations and inferenc"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2506.01078","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"cs.CV","submitted_at":"2025-06-01T16:28:26Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"9c7ce29c9289d69734355fd3a8910bb86cc8bda560df4239901f9473e98f8910","abstract_canon_sha256":"098c4e8d14654833362e2243b72c84ccdad87397e97b7f80e30718efb4c9561b"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:13:45.999616Z","signature_b64":"OcDTkWICK+0481yY9G05x/IEkXqlgjuBDobiz2tgAuczmyrMZCADh4zZwWk61XoNRVkJh7NyHn5/3NeYsnxQBg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"fd55146b5a9a522b3e4bc910080f21a879bd90d4eb0a05390cf8a57d03ff75d0","last_reissued_at":"2026-07-05T11:13:45.999139Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:13:45.999139Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CV","authors_text":"Can Zhang, Jinqiao Wang, Minghui Qiu, Ming Tang, Rongkun Xue, Ruipu Luo, Yifan Li, Yousong Zhu, Yufei Zhan, Zheming Yang, Zhenghao Chen, Zhentao He, Ziheng Wu","submitted_at":"2025-06-01T16:28:26Z","abstract_excerpt":"Despite notable advancements in multimodal reasoning, leading Multimodal Large Language Models (MLLMs) still underperform on vision-centric multimodal reasoning tasks in general scenarios. This shortfall stems from their predominant reliance on logic- and knowledge-based slow thinking strategies, while effective for domains like math and science, fail to integrate visual information effectively during reasoning. Consequently, these models often fail to adequately ground visual cues, resulting in suboptimal performance in tasks that require multiple plausible visual interpretations and inferenc"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2506.01078","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2506.01078/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2506.01078","created_at":"2026-07-05T11:13:45.999199+00:00"},{"alias_kind":"arxiv_version","alias_value":"2506.01078v1","created_at":"2026-07-05T11:13:45.999199+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2506.01078","created_at":"2026-07-05T11:13:45.999199+00:00"},{"alias_kind":"pith_short_12","alias_value":"7VKRI222TJJC","created_at":"2026-07-05T11:13:45.999199+00:00"},{"alias_kind":"pith_short_16","alias_value":"7VKRI222TJJCWPSL","created_at":"2026-07-05T11:13:45.999199+00:00"},{"alias_kind":"pith_short_8","alias_value":"7VKRI222","created_at":"2026-07-05T11:13:45.999199+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":4,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.26196","citing_title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","ref_index":217,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20177","citing_title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2509.02547","citing_title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","ref_index":240,"is_internal_anchor":false},{"citing_arxiv_id":"2604.24339","citing_title":"See Further, Think Deeper: Advancing VLM's Reasoning Ability with Low-level Visual Cues and Reflection","ref_index":59,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/7VKRI222TJJCWPSLZEIAQDZBVB","json":"https://pith.science/pith/7VKRI222TJJCWPSLZEIAQDZBVB.json","graph_json":"https://pith.science/api/pith-number/7VKRI222TJJCWPSLZEIAQDZBVB/graph.json","events_json":"https://pith.science/api/pith-number/7VKRI222TJJCWPSLZEIAQDZBVB/events.json","paper":"https://pith.science/paper/7VKRI222"},"agent_actions":{"view_html":"https://pith.science/pith/7VKRI222TJJCWPSLZEIAQDZBVB","download_json":"https://pith.science/pith/7VKRI222TJJCWPSLZEIAQDZBVB.json","view_paper":"https://pith.science/paper/7VKRI222","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2506.01078&json=true","fetch_graph":"https://pith.science/api/pith-number/7VKRI222TJJCWPSLZEIAQDZBVB/graph.json","fetch_events":"https://pith.science/api/pith-number/7VKRI222TJJCWPSLZEIAQDZBVB/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/7VKRI222TJJCWPSLZEIAQDZBVB/action/timestamp_anchor","attest_storage":"https://pith.science/pith/7VKRI222TJJCWPSLZEIAQDZBVB/action/storage_attestation","attest_author":"https://pith.science/pith/7VKRI222TJJCWPSLZEIAQDZBVB/action/author_attestation","sign_citation":"https://pith.science/pith/7VKRI222TJJCWPSLZEIAQDZBVB/action/citation_signature","submit_replication":"https://pith.science/pith/7VKRI222TJJCWPSLZEIAQDZBVB/action/replication_record"}},"created_at":"2026-07-05T11:13:45.999199+00:00","updated_at":"2026-07-05T11:13:45.999199+00:00"}