{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:L3TJHIVENZWXQKGCSWX7K7BO4B","short_pith_number":"pith:L3TJHIVE","schema_version":"1.0","canonical_sha256":"5ee693a2a46e6d7828c295aff57c2ee04b8429246e2880eec50329571ee1f894","source":{"kind":"arxiv","id":"2409.10719","version":3},"attestation_state":"computed","paper":{"title":"Benchmarking VLMs' Reasoning About Persuasive Atypical Images","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.MM"],"primary_cat":"cs.CV","authors_text":"Adriana Kovashka, Ashmit Khandelwal, Aysan Aghazadeh, Sina Malakouti","submitted_at":"2024-09-16T20:47:00Z","abstract_excerpt":"Vision language models (VLMs) have shown strong zero-shot generalization across various tasks, especially when integrated with large language models (LLMs). However, their ability to comprehend rhetorical and persuasive visual media, such as advertisements, remains understudied. Ads often employ atypical imagery, using surprising object juxtapositions to convey shared properties. For example, Fig. 1 (e) shows a beer with a feather-like texture. This requires advanced reasoning to deduce that this atypical representation signifies the beer's lightness. We introduce three novel tasks, Multi-labe"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2409.10719","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2024-09-16T20:47:00Z","cross_cats_sorted":["cs.MM"],"title_canon_sha256":"a3588480487c056c12959c4a61b80b8d2e57cc1676746efb513e90837d6908fb","abstract_canon_sha256":"2c6098ac382a8789c37c06dbd52e9f353b72f1b3cd54f8f4ee60b144588c430a"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:49:10.163841Z","signature_b64":"0SbtnIBb6tis3n5hnI9NiEaFoMgJzN9COi6X45zK0isKirG9xOi7COSsuGHES+S/r3P8OTv0LLSoA5Xm2N9ZDA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"5ee693a2a46e6d7828c295aff57c2ee04b8429246e2880eec50329571ee1f894","last_reissued_at":"2026-07-05T09:49:10.163336Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:49:10.163336Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Benchmarking VLMs' Reasoning About Persuasive Atypical Images","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.MM"],"primary_cat":"cs.CV","authors_text":"Adriana Kovashka, Ashmit Khandelwal, Aysan Aghazadeh, Sina Malakouti","submitted_at":"2024-09-16T20:47:00Z","abstract_excerpt":"Vision language models (VLMs) have shown strong zero-shot generalization across various tasks, especially when integrated with large language models (LLMs). However, their ability to comprehend rhetorical and persuasive visual media, such as advertisements, remains understudied. Ads often employ atypical imagery, using surprising object juxtapositions to convey shared properties. For example, Fig. 1 (e) shows a beer with a feather-like texture. This requires advanced reasoning to deduce that this atypical representation signifies the beer's lightness. We introduce three novel tasks, Multi-labe"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2409.10719","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2409.10719/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2409.10719","created_at":"2026-07-05T09:49:10.163403+00:00"},{"alias_kind":"arxiv_version","alias_value":"2409.10719v3","created_at":"2026-07-05T09:49:10.163403+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2409.10719","created_at":"2026-07-05T09:49:10.163403+00:00"},{"alias_kind":"pith_short_12","alias_value":"L3TJHIVENZWX","created_at":"2026-07-05T09:49:10.163403+00:00"},{"alias_kind":"pith_short_16","alias_value":"L3TJHIVENZWXQKGC","created_at":"2026-07-05T09:49:10.163403+00:00"},{"alias_kind":"pith_short_8","alias_value":"L3TJHIVE","created_at":"2026-07-05T09:49:10.163403+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2501.13964","citing_title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","ref_index":13,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/L3TJHIVENZWXQKGCSWX7K7BO4B","json":"https://pith.science/pith/L3TJHIVENZWXQKGCSWX7K7BO4B.json","graph_json":"https://pith.science/api/pith-number/L3TJHIVENZWXQKGCSWX7K7BO4B/graph.json","events_json":"https://pith.science/api/pith-number/L3TJHIVENZWXQKGCSWX7K7BO4B/events.json","paper":"https://pith.science/paper/L3TJHIVE"},"agent_actions":{"view_html":"https://pith.science/pith/L3TJHIVENZWXQKGCSWX7K7BO4B","download_json":"https://pith.science/pith/L3TJHIVENZWXQKGCSWX7K7BO4B.json","view_paper":"https://pith.science/paper/L3TJHIVE","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2409.10719&json=true","fetch_graph":"https://pith.science/api/pith-number/L3TJHIVENZWXQKGCSWX7K7BO4B/graph.json","fetch_events":"https://pith.science/api/pith-number/L3TJHIVENZWXQKGCSWX7K7BO4B/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/L3TJHIVENZWXQKGCSWX7K7BO4B/action/timestamp_anchor","attest_storage":"https://pith.science/pith/L3TJHIVENZWXQKGCSWX7K7BO4B/action/storage_attestation","attest_author":"https://pith.science/pith/L3TJHIVENZWXQKGCSWX7K7BO4B/action/author_attestation","sign_citation":"https://pith.science/pith/L3TJHIVENZWXQKGCSWX7K7BO4B/action/citation_signature","submit_replication":"https://pith.science/pith/L3TJHIVENZWXQKGCSWX7K7BO4B/action/replication_record"}},"created_at":"2026-07-05T09:49:10.163403+00:00","updated_at":"2026-07-05T09:49:10.163403+00:00"}