{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:CPBAEWDT76HSCOZJQKAWKH5NXU","short_pith_number":"pith:CPBAEWDT","schema_version":"1.0","canonical_sha256":"13c2025873ff8f213b298281651fadbd3bb0bcbcae48026afcb2ee49866bc7aa","source":{"kind":"arxiv","id":"2411.00836","version":2},"attestation_state":"computed","paper":{"title":"DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.CV","authors_text":"Bin Hu, Chengke Zou, Huan Zhang, Junyu Zhang, Rui Yang, Xingang Guo","submitted_at":"2024-10-29T17:29:19Z","abstract_excerpt":"The rapid advancements in Vision-Language Models (VLMs) have shown great potential in tackling mathematical reasoning tasks that involve visual context. Unlike humans who can reliably apply solution steps to similar problems with minor modifications, we found that SOTA VLMs like GPT-4o can consistently fail in these scenarios, revealing limitations in their mathematical reasoning capabilities. In this paper, we investigate the mathematical reasoning robustness in VLMs and evaluate how well these models perform under different variants of the same question, such as changes in visual numerical v"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2411.00836","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2024-10-29T17:29:19Z","cross_cats_sorted":["cs.AI","cs.CL"],"title_canon_sha256":"a89097622af148690084c143d73558ff1751ba7d9dc80115d7e6088806e5c9a2","abstract_canon_sha256":"9fcba2ba0fbeae30723eecfb6a69e5252446dcedcabea9a6c696e2b1544d4f3f"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:18:44.517223Z","signature_b64":"Lq2/pB9zIXf1tgtEWoAIcToTjxBFYRusJ3gCwhbOMG+uW7MF51zZQ+k8NXk2dwHJoQKM4OETEUVspX6NRJnvDA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"13c2025873ff8f213b298281651fadbd3bb0bcbcae48026afcb2ee49866bc7aa","last_reissued_at":"2026-07-05T10:18:44.516671Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:18:44.516671Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.CV","authors_text":"Bin Hu, Chengke Zou, Huan Zhang, Junyu Zhang, Rui Yang, Xingang Guo","submitted_at":"2024-10-29T17:29:19Z","abstract_excerpt":"The rapid advancements in Vision-Language Models (VLMs) have shown great potential in tackling mathematical reasoning tasks that involve visual context. Unlike humans who can reliably apply solution steps to similar problems with minor modifications, we found that SOTA VLMs like GPT-4o can consistently fail in these scenarios, revealing limitations in their mathematical reasoning capabilities. In this paper, we investigate the mathematical reasoning robustness in VLMs and evaluate how well these models perform under different variants of the same question, such as changes in visual numerical v"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2411.00836","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2411.00836/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2411.00836","created_at":"2026-07-05T10:18:44.516733+00:00"},{"alias_kind":"arxiv_version","alias_value":"2411.00836v2","created_at":"2026-07-05T10:18:44.516733+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2411.00836","created_at":"2026-07-05T10:18:44.516733+00:00"},{"alias_kind":"pith_short_12","alias_value":"CPBAEWDT76HS","created_at":"2026-07-05T10:18:44.516733+00:00"},{"alias_kind":"pith_short_16","alias_value":"CPBAEWDT76HSCOZJ","created_at":"2026-07-05T10:18:44.516733+00:00"},{"alias_kind":"pith_short_8","alias_value":"CPBAEWDT","created_at":"2026-07-05T10:18:44.516733+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":24,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.18216","citing_title":"Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients","ref_index":133,"is_internal_anchor":false},{"citing_arxiv_id":"2606.10651","citing_title":"Kwai Keye-VL-2.0 Technical Report","ref_index":113,"is_internal_anchor":false},{"citing_arxiv_id":"2606.08231","citing_title":"Test-Time Scaling in Multimodal Foundation Models: A Comprehensive Survey of Generation and Reasoning","ref_index":120,"is_internal_anchor":false},{"citing_arxiv_id":"2606.08034","citing_title":"Sci-Rho: A Multilingual Visually-Grounded Symbolic Benchmark for STEM Problems","ref_index":80,"is_internal_anchor":false},{"citing_arxiv_id":"2607.00248","citing_title":"Seed2.0 Model Card: Towards Intelligence Frontier for Real-World Complexity","ref_index":150,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01599","citing_title":"TRON: Targeted Rule-Verifiable Online Environments for Visual Reasoning RL","ref_index":50,"is_internal_anchor":false},{"citing_arxiv_id":"2606.24253","citing_title":"TuringViT: Making SOTA Vision Transformers Accessible to All","ref_index":68,"is_internal_anchor":false},{"citing_arxiv_id":"2605.19436","citing_title":"CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2605.19852","citing_title":"Are Tools Always Beneficial? Learning to Invoke Tools Adaptively for Dual-Mode Multimodal LLM Reasoning","ref_index":55,"is_internal_anchor":false},{"citing_arxiv_id":"2511.19972","citing_title":"Boosting Reasoning in Large Multimodal Models via Activation Replay","ref_index":68,"is_internal_anchor":false},{"citing_arxiv_id":"2601.04442","citing_title":"Addressing Overthinking in Large Vision-Language Models via Gated Perception-Reasoning Optimization","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2503.12937","citing_title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","ref_index":57,"is_internal_anchor":false},{"citing_arxiv_id":"2601.13606","citing_title":"ChartVerse: Scaling Chart Reasoning via Reliable Programmatic Synthesis from Scratch","ref_index":52,"is_internal_anchor":false},{"citing_arxiv_id":"2503.10615","citing_title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","ref_index":41,"is_internal_anchor":false},{"citing_arxiv_id":"2603.20633","citing_title":"Seed1.8 Model Card: Towards Generalized Real-World Agency","ref_index":98,"is_internal_anchor":false},{"citing_arxiv_id":"2604.19503","citing_title":"ReaLB: Real-Time Load Balancing for Multimodal MoE Inference","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2605.03677","citing_title":"Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe","ref_index":54,"is_internal_anchor":false},{"citing_arxiv_id":"2605.01327","citing_title":"Segment-Aligned Policy Optimization for Multi-Modal Reasoning","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2505.14362","citing_title":"DeepEyes: Incentivizing \"Thinking with Images\" via Reinforcement Learning","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2604.12358","citing_title":"Why and When Visual Token Pruning Fails? A Study on Relevant Visual Information Shift in MLLMs Decoding","ref_index":55,"is_internal_anchor":false},{"citing_arxiv_id":"2507.01006","citing_title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","ref_index":74,"is_internal_anchor":false},{"citing_arxiv_id":"2604.08545","citing_title":"Act Wisely: Cultivating Meta-Cognitive Tool Use in Agentic Multimodal Models","ref_index":58,"is_internal_anchor":false},{"citing_arxiv_id":"2504.10479","citing_title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","ref_index":156,"is_internal_anchor":false},{"citing_arxiv_id":"2508.18265","citing_title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","ref_index":190,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/CPBAEWDT76HSCOZJQKAWKH5NXU","json":"https://pith.science/pith/CPBAEWDT76HSCOZJQKAWKH5NXU.json","graph_json":"https://pith.science/api/pith-number/CPBAEWDT76HSCOZJQKAWKH5NXU/graph.json","events_json":"https://pith.science/api/pith-number/CPBAEWDT76HSCOZJQKAWKH5NXU/events.json","paper":"https://pith.science/paper/CPBAEWDT"},"agent_actions":{"view_html":"https://pith.science/pith/CPBAEWDT76HSCOZJQKAWKH5NXU","download_json":"https://pith.science/pith/CPBAEWDT76HSCOZJQKAWKH5NXU.json","view_paper":"https://pith.science/paper/CPBAEWDT","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2411.00836&json=true","fetch_graph":"https://pith.science/api/pith-number/CPBAEWDT76HSCOZJQKAWKH5NXU/graph.json","fetch_events":"https://pith.science/api/pith-number/CPBAEWDT76HSCOZJQKAWKH5NXU/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/CPBAEWDT76HSCOZJQKAWKH5NXU/action/timestamp_anchor","attest_storage":"https://pith.science/pith/CPBAEWDT76HSCOZJQKAWKH5NXU/action/storage_attestation","attest_author":"https://pith.science/pith/CPBAEWDT76HSCOZJQKAWKH5NXU/action/author_attestation","sign_citation":"https://pith.science/pith/CPBAEWDT76HSCOZJQKAWKH5NXU/action/citation_signature","submit_replication":"https://pith.science/pith/CPBAEWDT76HSCOZJQKAWKH5NXU/action/replication_record"}},"created_at":"2026-07-05T10:18:44.516733+00:00","updated_at":"2026-07-05T10:18:44.516733+00:00"}