{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:4RX7AZGQLNIN3E7APRER7A6TVK","short_pith_number":"pith:4RX7AZGQ","schema_version":"1.0","canonical_sha256":"e46ff064d05b50dd93e07c491f83d3aab6fdf8d5ef1da85285d54ae3750d5856","source":{"kind":"arxiv","id":"2410.02244","version":1},"attestation_state":"computed","paper":{"title":"Visual Prompting in LLMs for Enhancing Emotion Recognition","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Dylan Zhang, Qixuan Zhang, Sabrina Caldwell, Tom Gedeon, Wenjia Niu, Yang Liu, Zhenyue Qin, Zhifeng Wang","submitted_at":"2024-10-03T06:33:43Z","abstract_excerpt":"Vision Large Language Models (VLLMs) are transforming the intersection of computer vision and natural language processing. Nonetheless, the potential of using visual prompts for emotion recognition in these models remains largely unexplored and untapped. Traditional methods in VLLMs struggle with spatial localization and often discard valuable global context. To address this problem, we propose a Set-of-Vision prompting (SoV) approach that enhances zero-shot emotion recognition by using spatial information, such as bounding boxes and facial landmarks, to mark targets precisely. SoV improves ac"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2410.02244","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2024-10-03T06:33:43Z","cross_cats_sorted":[],"title_canon_sha256":"5c81face85843958804e8f6c364a20374c8ceafac76aa7010196ff0e565e1e8a","abstract_canon_sha256":"30900b052c0fdb576f1a1c75a771cd5e183ea210bed6d45378be1ef56fe95799"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:15:18.231189Z","signature_b64":"Liwj0ES81wVrD6gBQ2rzjFdIabeufrPWjykdand2K6qdpNhhKKFBpzbUtlBAr5vf6HuxvtcGJvq67H2qdkzxAQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"e46ff064d05b50dd93e07c491f83d3aab6fdf8d5ef1da85285d54ae3750d5856","last_reissued_at":"2026-07-05T09:15:18.230739Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:15:18.230739Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Visual Prompting in LLMs for Enhancing Emotion Recognition","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Dylan Zhang, Qixuan Zhang, Sabrina Caldwell, Tom Gedeon, Wenjia Niu, Yang Liu, Zhenyue Qin, Zhifeng Wang","submitted_at":"2024-10-03T06:33:43Z","abstract_excerpt":"Vision Large Language Models (VLLMs) are transforming the intersection of computer vision and natural language processing. Nonetheless, the potential of using visual prompts for emotion recognition in these models remains largely unexplored and untapped. Traditional methods in VLLMs struggle with spatial localization and often discard valuable global context. To address this problem, we propose a Set-of-Vision prompting (SoV) approach that enhances zero-shot emotion recognition by using spatial information, such as bounding boxes and facial landmarks, to mark targets precisely. SoV improves ac"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2410.02244","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2410.02244/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2410.02244","created_at":"2026-07-05T09:15:18.230796+00:00"},{"alias_kind":"arxiv_version","alias_value":"2410.02244v1","created_at":"2026-07-05T09:15:18.230796+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2410.02244","created_at":"2026-07-05T09:15:18.230796+00:00"},{"alias_kind":"pith_short_12","alias_value":"4RX7AZGQLNIN","created_at":"2026-07-05T09:15:18.230796+00:00"},{"alias_kind":"pith_short_16","alias_value":"4RX7AZGQLNIN3E7A","created_at":"2026-07-05T09:15:18.230796+00:00"},{"alias_kind":"pith_short_8","alias_value":"4RX7AZGQ","created_at":"2026-07-05T09:15:18.230796+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/4RX7AZGQLNIN3E7APRER7A6TVK","json":"https://pith.science/pith/4RX7AZGQLNIN3E7APRER7A6TVK.json","graph_json":"https://pith.science/api/pith-number/4RX7AZGQLNIN3E7APRER7A6TVK/graph.json","events_json":"https://pith.science/api/pith-number/4RX7AZGQLNIN3E7APRER7A6TVK/events.json","paper":"https://pith.science/paper/4RX7AZGQ"},"agent_actions":{"view_html":"https://pith.science/pith/4RX7AZGQLNIN3E7APRER7A6TVK","download_json":"https://pith.science/pith/4RX7AZGQLNIN3E7APRER7A6TVK.json","view_paper":"https://pith.science/paper/4RX7AZGQ","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2410.02244&json=true","fetch_graph":"https://pith.science/api/pith-number/4RX7AZGQLNIN3E7APRER7A6TVK/graph.json","fetch_events":"https://pith.science/api/pith-number/4RX7AZGQLNIN3E7APRER7A6TVK/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/4RX7AZGQLNIN3E7APRER7A6TVK/action/timestamp_anchor","attest_storage":"https://pith.science/pith/4RX7AZGQLNIN3E7APRER7A6TVK/action/storage_attestation","attest_author":"https://pith.science/pith/4RX7AZGQLNIN3E7APRER7A6TVK/action/author_attestation","sign_citation":"https://pith.science/pith/4RX7AZGQLNIN3E7APRER7A6TVK/action/citation_signature","submit_replication":"https://pith.science/pith/4RX7AZGQLNIN3E7APRER7A6TVK/action/replication_record"}},"created_at":"2026-07-05T09:15:18.230796+00:00","updated_at":"2026-07-05T09:15:18.230796+00:00"}