{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:WC3H6Z4C3OOMHVSTW6OJ33WYAH","short_pith_number":"pith:WC3H6Z4C","schema_version":"1.0","canonical_sha256":"b0b67f6782db9cc3d653b79c9deed801de0b193b3596675cc3969b66b791776e","source":{"kind":"arxiv","id":"2410.05210","version":1},"attestation_state":"computed","paper":{"title":"Preserving Multi-Modal Capabilities of Pre-trained VLMs for Improving Vision-Linguistic Compositionality","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.CV","authors_text":"Dong-Jin Kim, In So Kweon, Jae Won Cho, Junmo Kim, Youngtaek Oh","submitted_at":"2024-10-07T17:16:20Z","abstract_excerpt":"In this paper, we propose a new method to enhance compositional understanding in pre-trained vision and language models (VLMs) without sacrificing performance in zero-shot multi-modal tasks. Traditional fine-tuning approaches often improve compositional reasoning at the cost of degrading multi-modal capabilities, primarily due to the use of global hard negative (HN) loss, which contrasts global representations of images and texts. This global HN loss pushes HN texts that are highly similar to the original ones, damaging the model's multi-modal representations. To overcome this limitation, we p"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2410.05210","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2024-10-07T17:16:20Z","cross_cats_sorted":["cs.AI","cs.CL"],"title_canon_sha256":"70cbe2165d9a847b0c6c9f14a5839abd6becfdd6fc1afec5e2f4661aed20bd82","abstract_canon_sha256":"71085690f55a540bdfc9b1daa555404241fd03fbdf2d1947ce6ae38530081b7c"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:17:03.834497Z","signature_b64":"arULMR9AgYpFPhYjJ1VZfU49QPRtq3hNFYnBdf2b+j0d8tMFIdE7maQ1Tdj1/hPna9s6gvROAHuB7rPrSWNfDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"b0b67f6782db9cc3d653b79c9deed801de0b193b3596675cc3969b66b791776e","last_reissued_at":"2026-07-05T09:17:03.834005Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:17:03.834005Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Preserving Multi-Modal Capabilities of Pre-trained VLMs for Improving Vision-Linguistic Compositionality","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.CV","authors_text":"Dong-Jin Kim, In So Kweon, Jae Won Cho, Junmo Kim, Youngtaek Oh","submitted_at":"2024-10-07T17:16:20Z","abstract_excerpt":"In this paper, we propose a new method to enhance compositional understanding in pre-trained vision and language models (VLMs) without sacrificing performance in zero-shot multi-modal tasks. Traditional fine-tuning approaches often improve compositional reasoning at the cost of degrading multi-modal capabilities, primarily due to the use of global hard negative (HN) loss, which contrasts global representations of images and texts. This global HN loss pushes HN texts that are highly similar to the original ones, damaging the model's multi-modal representations. To overcome this limitation, we p"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2410.05210","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2410.05210/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2410.05210","created_at":"2026-07-05T09:17:03.834063+00:00"},{"alias_kind":"arxiv_version","alias_value":"2410.05210v1","created_at":"2026-07-05T09:17:03.834063+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2410.05210","created_at":"2026-07-05T09:17:03.834063+00:00"},{"alias_kind":"pith_short_12","alias_value":"WC3H6Z4C3OOM","created_at":"2026-07-05T09:17:03.834063+00:00"},{"alias_kind":"pith_short_16","alias_value":"WC3H6Z4C3OOMHVST","created_at":"2026-07-05T09:17:03.834063+00:00"},{"alias_kind":"pith_short_8","alias_value":"WC3H6Z4C","created_at":"2026-07-05T09:17:03.834063+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":2,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.26794","citing_title":"ReasonCLIP-58M: Visually Grounded Commonsense Reasoning Supervision for CLIP","ref_index":64,"is_internal_anchor":false},{"citing_arxiv_id":"2606.13288","citing_title":"Cross-Modal Masked Compositional Concept Modeling for Enhancing Visio-Linguistic Compositionality","ref_index":57,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/WC3H6Z4C3OOMHVSTW6OJ33WYAH","json":"https://pith.science/pith/WC3H6Z4C3OOMHVSTW6OJ33WYAH.json","graph_json":"https://pith.science/api/pith-number/WC3H6Z4C3OOMHVSTW6OJ33WYAH/graph.json","events_json":"https://pith.science/api/pith-number/WC3H6Z4C3OOMHVSTW6OJ33WYAH/events.json","paper":"https://pith.science/paper/WC3H6Z4C"},"agent_actions":{"view_html":"https://pith.science/pith/WC3H6Z4C3OOMHVSTW6OJ33WYAH","download_json":"https://pith.science/pith/WC3H6Z4C3OOMHVSTW6OJ33WYAH.json","view_paper":"https://pith.science/paper/WC3H6Z4C","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2410.05210&json=true","fetch_graph":"https://pith.science/api/pith-number/WC3H6Z4C3OOMHVSTW6OJ33WYAH/graph.json","fetch_events":"https://pith.science/api/pith-number/WC3H6Z4C3OOMHVSTW6OJ33WYAH/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/WC3H6Z4C3OOMHVSTW6OJ33WYAH/action/timestamp_anchor","attest_storage":"https://pith.science/pith/WC3H6Z4C3OOMHVSTW6OJ33WYAH/action/storage_attestation","attest_author":"https://pith.science/pith/WC3H6Z4C3OOMHVSTW6OJ33WYAH/action/author_attestation","sign_citation":"https://pith.science/pith/WC3H6Z4C3OOMHVSTW6OJ33WYAH/action/citation_signature","submit_replication":"https://pith.science/pith/WC3H6Z4C3OOMHVSTW6OJ33WYAH/action/replication_record"}},"created_at":"2026-07-05T09:17:03.834063+00:00","updated_at":"2026-07-05T09:17:03.834063+00:00"}