{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:FFEDK6B56DVQJZ2CRBN6YMPG2S","short_pith_number":"pith:FFEDK6B5","schema_version":"1.0","canonical_sha256":"294835783df0eb04e742885bec31e6d4869a4d0e0c732863c7e70e727ab2f85f","source":{"kind":"arxiv","id":"2508.04942","version":1},"attestation_state":"computed","paper":{"title":"Accelerating Conditional Prompt Learning via Masked Image Modeling for Vision-Language Models","license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Hyunseung Choo, Khanh-Binh Nguyen, Phuoc-Nguyen Bui","submitted_at":"2025-08-07T00:08:31Z","abstract_excerpt":"Vision-language models (VLMs) like CLIP excel in zero-shot learning but often require resource-intensive training to adapt to new tasks. Prompt learning techniques, such as CoOp and CoCoOp, offer efficient adaptation but tend to overfit to known classes, limiting generalization to unseen categories. We introduce ProMIM, a plug-and-play framework that enhances conditional prompt learning by integrating masked image modeling (MIM) into existing VLM pipelines. ProMIM leverages a simple yet effective masking strategy to generate robust, instance-conditioned prompts, seamlessly augmenting methods l"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2508.04942","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","primary_cat":"cs.CV","submitted_at":"2025-08-07T00:08:31Z","cross_cats_sorted":[],"title_canon_sha256":"c18104b5f8fd1942c64190838073b70eca13e7995d497dd73b0b093b976ca81a","abstract_canon_sha256":"c8f0d354119bfb0d2ac53d3fee9d8af58a5b2f1cbab715f81128a17bbbdb8e72"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:50:04.372212Z","signature_b64":"fou79s58MExiRSB3MvRMpOM2p4nynNY+G6jceiD/iu0KMgNQs5OpOuv3htJlFoV5lWLnVSP4/cKBuZOTfHQDCg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"294835783df0eb04e742885bec31e6d4869a4d0e0c732863c7e70e727ab2f85f","last_reissued_at":"2026-07-05T11:50:04.371829Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:50:04.371829Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Accelerating Conditional Prompt Learning via Masked Image Modeling for Vision-Language Models","license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Hyunseung Choo, Khanh-Binh Nguyen, Phuoc-Nguyen Bui","submitted_at":"2025-08-07T00:08:31Z","abstract_excerpt":"Vision-language models (VLMs) like CLIP excel in zero-shot learning but often require resource-intensive training to adapt to new tasks. Prompt learning techniques, such as CoOp and CoCoOp, offer efficient adaptation but tend to overfit to known classes, limiting generalization to unseen categories. We introduce ProMIM, a plug-and-play framework that enhances conditional prompt learning by integrating masked image modeling (MIM) into existing VLM pipelines. ProMIM leverages a simple yet effective masking strategy to generate robust, instance-conditioned prompts, seamlessly augmenting methods l"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2508.04942","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2508.04942/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2508.04942","created_at":"2026-07-05T11:50:04.371883+00:00"},{"alias_kind":"arxiv_version","alias_value":"2508.04942v1","created_at":"2026-07-05T11:50:04.371883+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2508.04942","created_at":"2026-07-05T11:50:04.371883+00:00"},{"alias_kind":"pith_short_12","alias_value":"FFEDK6B56DVQ","created_at":"2026-07-05T11:50:04.371883+00:00"},{"alias_kind":"pith_short_16","alias_value":"FFEDK6B56DVQJZ2C","created_at":"2026-07-05T11:50:04.371883+00:00"},{"alias_kind":"pith_short_8","alias_value":"FFEDK6B5","created_at":"2026-07-05T11:50:04.371883+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2509.03895","citing_title":"Attn-Adapter: Attention Is All You Need for Online Few-shot Learner of Vision-Language Model","ref_index":1,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/FFEDK6B56DVQJZ2CRBN6YMPG2S","json":"https://pith.science/pith/FFEDK6B56DVQJZ2CRBN6YMPG2S.json","graph_json":"https://pith.science/api/pith-number/FFEDK6B56DVQJZ2CRBN6YMPG2S/graph.json","events_json":"https://pith.science/api/pith-number/FFEDK6B56DVQJZ2CRBN6YMPG2S/events.json","paper":"https://pith.science/paper/FFEDK6B5"},"agent_actions":{"view_html":"https://pith.science/pith/FFEDK6B56DVQJZ2CRBN6YMPG2S","download_json":"https://pith.science/pith/FFEDK6B56DVQJZ2CRBN6YMPG2S.json","view_paper":"https://pith.science/paper/FFEDK6B5","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2508.04942&json=true","fetch_graph":"https://pith.science/api/pith-number/FFEDK6B56DVQJZ2CRBN6YMPG2S/graph.json","fetch_events":"https://pith.science/api/pith-number/FFEDK6B56DVQJZ2CRBN6YMPG2S/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/FFEDK6B56DVQJZ2CRBN6YMPG2S/action/timestamp_anchor","attest_storage":"https://pith.science/pith/FFEDK6B56DVQJZ2CRBN6YMPG2S/action/storage_attestation","attest_author":"https://pith.science/pith/FFEDK6B56DVQJZ2CRBN6YMPG2S/action/author_attestation","sign_citation":"https://pith.science/pith/FFEDK6B56DVQJZ2CRBN6YMPG2S/action/citation_signature","submit_replication":"https://pith.science/pith/FFEDK6B56DVQJZ2CRBN6YMPG2S/action/replication_record"}},"created_at":"2026-07-05T11:50:04.371883+00:00","updated_at":"2026-07-05T11:50:04.371883+00:00"}