{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:EAGXZFQUDREX7ONWRY54FS7T63","short_pith_number":"pith:EAGXZFQU","schema_version":"1.0","canonical_sha256":"200d7c96141c497fb9b68e3bc2cbf3f6e09c076580037b40652db25efd1936d7","source":{"kind":"arxiv","id":"2312.12241","version":1},"attestation_state":"computed","paper":{"title":"GeomVerse: A Systematic Evaluation of Large Models for Geometric Reasoning","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.CV","authors_text":"Ankit Anand, Hamidreza Alvari, Jialin Wu, Mehran Kazemi, Radu Soricut, Xi Chen","submitted_at":"2023-12-19T15:25:39Z","abstract_excerpt":"Large language models have shown impressive results for multi-hop mathematical reasoning when the input question is only textual. Many mathematical reasoning problems, however, contain both text and image. With the ever-increasing adoption of vision language models (VLMs), understanding their reasoning abilities for such problems is crucial. In this paper, we evaluate the reasoning capabilities of VLMs along various axes through the lens of geometry problems. We procedurally create a synthetic dataset of geometry questions with controllable difficulty levels along multiple axes, thus enabling "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2312.12241","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2023-12-19T15:25:39Z","cross_cats_sorted":["cs.CL"],"title_canon_sha256":"0a03cd10e02d4b2030ec6984dd41b633c738b2867d01e135507e5b8a62442560","abstract_canon_sha256":"6985f051f720d729098a623a0ed25f4b1ab5f557eb01753b72d1d49adc26a513"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T07:26:00.924984Z","signature_b64":"iVaLdbkORfAyIdndQVU7K+/l27rdXd/ZAg9be0P6zEetfuxLIoWXNTYy+nqfMhQzDY1YcxnfDca2IW2ilCaCCA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"200d7c96141c497fb9b68e3bc2cbf3f6e09c076580037b40652db25efd1936d7","last_reissued_at":"2026-07-05T07:26:00.924514Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T07:26:00.924514Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"GeomVerse: A Systematic Evaluation of Large Models for Geometric Reasoning","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.CV","authors_text":"Ankit Anand, Hamidreza Alvari, Jialin Wu, Mehran Kazemi, Radu Soricut, Xi Chen","submitted_at":"2023-12-19T15:25:39Z","abstract_excerpt":"Large language models have shown impressive results for multi-hop mathematical reasoning when the input question is only textual. Many mathematical reasoning problems, however, contain both text and image. With the ever-increasing adoption of vision language models (VLMs), understanding their reasoning abilities for such problems is crucial. In this paper, we evaluate the reasoning capabilities of VLMs along various axes through the lens of geometry problems. We procedurally create a synthetic dataset of geometry questions with controllable difficulty levels along multiple axes, thus enabling "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2312.12241","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2312.12241/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2312.12241","created_at":"2026-07-05T07:26:00.924579+00:00"},{"alias_kind":"arxiv_version","alias_value":"2312.12241v1","created_at":"2026-07-05T07:26:00.924579+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2312.12241","created_at":"2026-07-05T07:26:00.924579+00:00"},{"alias_kind":"pith_short_12","alias_value":"EAGXZFQUDREX","created_at":"2026-07-05T07:26:00.924579+00:00"},{"alias_kind":"pith_short_16","alias_value":"EAGXZFQUDREX7ONW","created_at":"2026-07-05T07:26:00.924579+00:00"},{"alias_kind":"pith_short_8","alias_value":"EAGXZFQU","created_at":"2026-07-05T07:26:00.924579+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":14,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.18216","citing_title":"Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients","ref_index":99,"is_internal_anchor":false},{"citing_arxiv_id":"2606.28551","citing_title":"DataComp-VLM: Improved Open Datasets for Vision-Language Models","ref_index":125,"is_internal_anchor":false},{"citing_arxiv_id":"2606.28551","citing_title":"DataComp-VLM: Improved Open Datasets for Vision-Language Models","ref_index":125,"is_internal_anchor":false},{"citing_arxiv_id":"2606.27378","citing_title":"Formalizing Latent Thoughts: Four Axioms of Thought Representation in LLMs","ref_index":44,"is_internal_anchor":false},{"citing_arxiv_id":"2606.00820","citing_title":"Not All Flips Are Conformity: Decomposing Stance Convergence in Multi-Agent LLM Debate","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2503.19786","citing_title":"Gemma 3 Technical Report","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2504.09925","citing_title":"FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2506.06856","citing_title":"Vision-EKIPL: External Knowledge-Infused Policy Learning for Visual Reasoning","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2412.14164","citing_title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","ref_index":131,"is_internal_anchor":false},{"citing_arxiv_id":"2408.16500","citing_title":"CogVLM2: Visual Language Models for Image and Video Understanding","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2411.10442","citing_title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","ref_index":39,"is_internal_anchor":false},{"citing_arxiv_id":"2408.03326","citing_title":"LLaVA-OneVision: Easy Visual Task Transfer","ref_index":52,"is_internal_anchor":false},{"citing_arxiv_id":"2504.10479","citing_title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","ref_index":55,"is_internal_anchor":false},{"citing_arxiv_id":"2412.05271","citing_title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","ref_index":107,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/EAGXZFQUDREX7ONWRY54FS7T63","json":"https://pith.science/pith/EAGXZFQUDREX7ONWRY54FS7T63.json","graph_json":"https://pith.science/api/pith-number/EAGXZFQUDREX7ONWRY54FS7T63/graph.json","events_json":"https://pith.science/api/pith-number/EAGXZFQUDREX7ONWRY54FS7T63/events.json","paper":"https://pith.science/paper/EAGXZFQU"},"agent_actions":{"view_html":"https://pith.science/pith/EAGXZFQUDREX7ONWRY54FS7T63","download_json":"https://pith.science/pith/EAGXZFQUDREX7ONWRY54FS7T63.json","view_paper":"https://pith.science/paper/EAGXZFQU","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2312.12241&json=true","fetch_graph":"https://pith.science/api/pith-number/EAGXZFQUDREX7ONWRY54FS7T63/graph.json","fetch_events":"https://pith.science/api/pith-number/EAGXZFQUDREX7ONWRY54FS7T63/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/EAGXZFQUDREX7ONWRY54FS7T63/action/timestamp_anchor","attest_storage":"https://pith.science/pith/EAGXZFQUDREX7ONWRY54FS7T63/action/storage_attestation","attest_author":"https://pith.science/pith/EAGXZFQUDREX7ONWRY54FS7T63/action/author_attestation","sign_citation":"https://pith.science/pith/EAGXZFQUDREX7ONWRY54FS7T63/action/citation_signature","submit_replication":"https://pith.science/pith/EAGXZFQUDREX7ONWRY54FS7T63/action/replication_record"}},"created_at":"2026-07-05T07:26:00.924579+00:00","updated_at":"2026-07-05T07:26:00.924579+00:00"}