{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:STHZO6WBP3OHIEHQXRWSDSQ3WE","short_pith_number":"pith:STHZO6WB","schema_version":"1.0","canonical_sha256":"94cf977ac17edc7410f0bc6d21ca1bb129f72c70c6fc874b94369fe180511130","source":{"kind":"arxiv","id":"2410.05928","version":1},"attestation_state":"computed","paper":{"title":"Beyond Captioning: Task-Specific Prompting for Improved VLM Performance in Mathematical Reasoning","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.CV","authors_text":"Abhinav Kumar, Ayush Singh, Mansi Gupta, Shivank Garg, Vansh Agrawal","submitted_at":"2024-10-08T11:29:40Z","abstract_excerpt":"Vision-Language Models (VLMs) have transformed tasks requiring visual and reasoning abilities, such as image retrieval and Visual Question Answering (VQA). Despite their success, VLMs face significant challenges with tasks involving geometric reasoning, algebraic problem-solving, and counting. These limitations stem from difficulties effectively integrating multiple modalities and accurately interpreting geometry-related tasks. Various works claim that introducing a captioning pipeline before VQA tasks enhances performance. We incorporated this pipeline for tasks involving geometry, algebra, a"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2410.05928","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2024-10-08T11:29:40Z","cross_cats_sorted":["cs.AI","cs.CL"],"title_canon_sha256":"19a2f2a7464b7bb72b51ce2d9138ab8a1728b3ce5a9fb9d71d8ff026611ef803","abstract_canon_sha256":"fc3ab670e2a63cd05ab837f9c3a082b88364184ad4f47008e1d88b756ab848e6"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:17:52.992275Z","signature_b64":"MZZXCxY85KSM+3cN3SzRizEgDBJbvdv1HtHTTsl261ZTwJsXvusveEEmAgrbBPpMp5CtLrrc2Csa9lH22eQtDA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"94cf977ac17edc7410f0bc6d21ca1bb129f72c70c6fc874b94369fe180511130","last_reissued_at":"2026-07-05T09:17:52.991804Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:17:52.991804Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Beyond Captioning: Task-Specific Prompting for Improved VLM Performance in Mathematical Reasoning","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.CV","authors_text":"Abhinav Kumar, Ayush Singh, Mansi Gupta, Shivank Garg, Vansh Agrawal","submitted_at":"2024-10-08T11:29:40Z","abstract_excerpt":"Vision-Language Models (VLMs) have transformed tasks requiring visual and reasoning abilities, such as image retrieval and Visual Question Answering (VQA). Despite their success, VLMs face significant challenges with tasks involving geometric reasoning, algebraic problem-solving, and counting. These limitations stem from difficulties effectively integrating multiple modalities and accurately interpreting geometry-related tasks. Various works claim that introducing a captioning pipeline before VQA tasks enhances performance. We incorporated this pipeline for tasks involving geometry, algebra, a"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2410.05928","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2410.05928/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2410.05928","created_at":"2026-07-05T09:17:52.991873+00:00"},{"alias_kind":"arxiv_version","alias_value":"2410.05928v1","created_at":"2026-07-05T09:17:52.991873+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2410.05928","created_at":"2026-07-05T09:17:52.991873+00:00"},{"alias_kind":"pith_short_12","alias_value":"STHZO6WBP3OH","created_at":"2026-07-05T09:17:52.991873+00:00"},{"alias_kind":"pith_short_16","alias_value":"STHZO6WBP3OHIEHQ","created_at":"2026-07-05T09:17:52.991873+00:00"},{"alias_kind":"pith_short_8","alias_value":"STHZO6WB","created_at":"2026-07-05T09:17:52.991873+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2507.11936","citing_title":"A Survey of Deep Learning for Geometry Problem Solving","ref_index":15,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/STHZO6WBP3OHIEHQXRWSDSQ3WE","json":"https://pith.science/pith/STHZO6WBP3OHIEHQXRWSDSQ3WE.json","graph_json":"https://pith.science/api/pith-number/STHZO6WBP3OHIEHQXRWSDSQ3WE/graph.json","events_json":"https://pith.science/api/pith-number/STHZO6WBP3OHIEHQXRWSDSQ3WE/events.json","paper":"https://pith.science/paper/STHZO6WB"},"agent_actions":{"view_html":"https://pith.science/pith/STHZO6WBP3OHIEHQXRWSDSQ3WE","download_json":"https://pith.science/pith/STHZO6WBP3OHIEHQXRWSDSQ3WE.json","view_paper":"https://pith.science/paper/STHZO6WB","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2410.05928&json=true","fetch_graph":"https://pith.science/api/pith-number/STHZO6WBP3OHIEHQXRWSDSQ3WE/graph.json","fetch_events":"https://pith.science/api/pith-number/STHZO6WBP3OHIEHQXRWSDSQ3WE/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/STHZO6WBP3OHIEHQXRWSDSQ3WE/action/timestamp_anchor","attest_storage":"https://pith.science/pith/STHZO6WBP3OHIEHQXRWSDSQ3WE/action/storage_attestation","attest_author":"https://pith.science/pith/STHZO6WBP3OHIEHQXRWSDSQ3WE/action/author_attestation","sign_citation":"https://pith.science/pith/STHZO6WBP3OHIEHQXRWSDSQ3WE/action/citation_signature","submit_replication":"https://pith.science/pith/STHZO6WBP3OHIEHQXRWSDSQ3WE/action/replication_record"}},"created_at":"2026-07-05T09:17:52.991873+00:00","updated_at":"2026-07-05T09:17:52.991873+00:00"}