{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:NPTNAW3D7CVCKU5N7DIJZ6MT6K","short_pith_number":"pith:NPTNAW3D","schema_version":"1.0","canonical_sha256":"6be6d05b63f8aa2553adf8d09cf993f2a05b0c4479f2a64fc0f55f24dbc2330b","source":{"kind":"arxiv","id":"2406.14544","version":1},"attestation_state":"computed","paper":{"title":"Prism: A Framework for Decoupling and Assessing the Capabilities of VLMs","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.CV","authors_text":"Dahua Lin, Haodong Duan, Jiaqi Wang, Junming Yang, Kai Chen, Lin Chen, Songyang Zhang, Xinyu Fang, Yuxuan Qiao","submitted_at":"2024-06-20T17:54:03Z","abstract_excerpt":"Vision Language Models (VLMs) demonstrate remarkable proficiency in addressing a wide array of visual questions, which requires strong perception and reasoning faculties. Assessing these two competencies independently is crucial for model refinement, despite the inherent difficulty due to the intertwined nature of seeing and reasoning in existing VLMs. To tackle this issue, we present Prism, an innovative framework designed to disentangle the perception and reasoning processes involved in visual question solving. Prism comprises two distinct stages: a perception stage that utilizes a VLM to ex"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2406.14544","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2024-06-20T17:54:03Z","cross_cats_sorted":["cs.CL"],"title_canon_sha256":"9ba6ce720a40f6dae67c211f8838e3c6b9a303ae28005c6b558aee911232c770","abstract_canon_sha256":"1d66cd0ca72114fe2a2a8d6e7f090969ada6e80bb0c759f0fb6f31854b37e381"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:34:52.053464Z","signature_b64":"ngdQ0cGqIK99II8RGz36OZ6kvFpfIBcjLsY/8ZLs1C5Wyi7hpI4huEusp//zJjlz7f8LCKErvvTFnOsFmvWEAw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"6be6d05b63f8aa2553adf8d09cf993f2a05b0c4479f2a64fc0f55f24dbc2330b","last_reissued_at":"2026-07-05T08:34:52.053007Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:34:52.053007Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Prism: A Framework for Decoupling and Assessing the Capabilities of VLMs","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.CV","authors_text":"Dahua Lin, Haodong Duan, Jiaqi Wang, Junming Yang, Kai Chen, Lin Chen, Songyang Zhang, Xinyu Fang, Yuxuan Qiao","submitted_at":"2024-06-20T17:54:03Z","abstract_excerpt":"Vision Language Models (VLMs) demonstrate remarkable proficiency in addressing a wide array of visual questions, which requires strong perception and reasoning faculties. Assessing these two competencies independently is crucial for model refinement, despite the inherent difficulty due to the intertwined nature of seeing and reasoning in existing VLMs. To tackle this issue, we present Prism, an innovative framework designed to disentangle the perception and reasoning processes involved in visual question solving. Prism comprises two distinct stages: a perception stage that utilizes a VLM to ex"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2406.14544","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2406.14544/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2406.14544","created_at":"2026-07-05T08:34:52.053071+00:00"},{"alias_kind":"arxiv_version","alias_value":"2406.14544v1","created_at":"2026-07-05T08:34:52.053071+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2406.14544","created_at":"2026-07-05T08:34:52.053071+00:00"},{"alias_kind":"pith_short_12","alias_value":"NPTNAW3D7CVC","created_at":"2026-07-05T08:34:52.053071+00:00"},{"alias_kind":"pith_short_16","alias_value":"NPTNAW3D7CVCKU5N","created_at":"2026-07-05T08:34:52.053071+00:00"},{"alias_kind":"pith_short_8","alias_value":"NPTNAW3D","created_at":"2026-07-05T08:34:52.053071+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2501.15144","citing_title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","ref_index":13,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/NPTNAW3D7CVCKU5N7DIJZ6MT6K","json":"https://pith.science/pith/NPTNAW3D7CVCKU5N7DIJZ6MT6K.json","graph_json":"https://pith.science/api/pith-number/NPTNAW3D7CVCKU5N7DIJZ6MT6K/graph.json","events_json":"https://pith.science/api/pith-number/NPTNAW3D7CVCKU5N7DIJZ6MT6K/events.json","paper":"https://pith.science/paper/NPTNAW3D"},"agent_actions":{"view_html":"https://pith.science/pith/NPTNAW3D7CVCKU5N7DIJZ6MT6K","download_json":"https://pith.science/pith/NPTNAW3D7CVCKU5N7DIJZ6MT6K.json","view_paper":"https://pith.science/paper/NPTNAW3D","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2406.14544&json=true","fetch_graph":"https://pith.science/api/pith-number/NPTNAW3D7CVCKU5N7DIJZ6MT6K/graph.json","fetch_events":"https://pith.science/api/pith-number/NPTNAW3D7CVCKU5N7DIJZ6MT6K/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/NPTNAW3D7CVCKU5N7DIJZ6MT6K/action/timestamp_anchor","attest_storage":"https://pith.science/pith/NPTNAW3D7CVCKU5N7DIJZ6MT6K/action/storage_attestation","attest_author":"https://pith.science/pith/NPTNAW3D7CVCKU5N7DIJZ6MT6K/action/author_attestation","sign_citation":"https://pith.science/pith/NPTNAW3D7CVCKU5N7DIJZ6MT6K/action/citation_signature","submit_replication":"https://pith.science/pith/NPTNAW3D7CVCKU5N7DIJZ6MT6K/action/replication_record"}},"created_at":"2026-07-05T08:34:52.053071+00:00","updated_at":"2026-07-05T08:34:52.053071+00:00"}