{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:OHMSFPSZHXSCWXL6MFAOSJKRBP","short_pith_number":"pith:OHMSFPSZ","schema_version":"1.0","canonical_sha256":"71d922be593de42b5d7e6140e925510bd00a9687762239bc2d8c54662ae6b87c","source":{"kind":"arxiv","id":"2412.07119","version":1},"attestation_state":"computed","paper":{"title":"DiffCLIP: Few-shot Language-driven Multimodal Classifier","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Jiaqing Zhang, Kai Jiang, Mingxiang Cao, Xue Yang, Yunsong Li","submitted_at":"2024-12-10T02:21:39Z","abstract_excerpt":"Visual language models like Contrastive Language-Image Pretraining (CLIP) have shown impressive performance in analyzing natural images with language information. However, these models often encounter challenges when applied to specialized domains such as remote sensing due to the limited availability of image-text pairs for training. To tackle this issue, we introduce DiffCLIP, a novel framework that extends CLIP to effectively convey comprehensive language-driven semantic information for accurate classification of high-dimensional multimodal remote sensing images. DiffCLIP is a few-shot lear"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2412.07119","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2024-12-10T02:21:39Z","cross_cats_sorted":[],"title_canon_sha256":"ee13335a1d9516df107c01f76335ee07d74ab19d33aa58ae15f8d0ae920de472","abstract_canon_sha256":"ffa1c30c76540e760e6dc34226fcb8b238861442f3c6dfc306c118a9b9487481"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:47:04.252119Z","signature_b64":"BObjTnPEzoKXQw7Gy06owljTiGeTxN0Z+lbeGCD8XRNKNfmZsXJC3qxrisBgjmGPj5n/qRuDKEdMt/rPl2JKBw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"71d922be593de42b5d7e6140e925510bd00a9687762239bc2d8c54662ae6b87c","last_reissued_at":"2026-07-05T09:47:04.251562Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:47:04.251562Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"DiffCLIP: Few-shot Language-driven Multimodal Classifier","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Jiaqing Zhang, Kai Jiang, Mingxiang Cao, Xue Yang, Yunsong Li","submitted_at":"2024-12-10T02:21:39Z","abstract_excerpt":"Visual language models like Contrastive Language-Image Pretraining (CLIP) have shown impressive performance in analyzing natural images with language information. However, these models often encounter challenges when applied to specialized domains such as remote sensing due to the limited availability of image-text pairs for training. To tackle this issue, we introduce DiffCLIP, a novel framework that extends CLIP to effectively convey comprehensive language-driven semantic information for accurate classification of high-dimensional multimodal remote sensing images. DiffCLIP is a few-shot lear"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2412.07119","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2412.07119/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2412.07119","created_at":"2026-07-05T09:47:04.251616+00:00"},{"alias_kind":"arxiv_version","alias_value":"2412.07119v1","created_at":"2026-07-05T09:47:04.251616+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2412.07119","created_at":"2026-07-05T09:47:04.251616+00:00"},{"alias_kind":"pith_short_12","alias_value":"OHMSFPSZHXSC","created_at":"2026-07-05T09:47:04.251616+00:00"},{"alias_kind":"pith_short_16","alias_value":"OHMSFPSZHXSCWXL6","created_at":"2026-07-05T09:47:04.251616+00:00"},{"alias_kind":"pith_short_8","alias_value":"OHMSFPSZ","created_at":"2026-07-05T09:47:04.251616+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/OHMSFPSZHXSCWXL6MFAOSJKRBP","json":"https://pith.science/pith/OHMSFPSZHXSCWXL6MFAOSJKRBP.json","graph_json":"https://pith.science/api/pith-number/OHMSFPSZHXSCWXL6MFAOSJKRBP/graph.json","events_json":"https://pith.science/api/pith-number/OHMSFPSZHXSCWXL6MFAOSJKRBP/events.json","paper":"https://pith.science/paper/OHMSFPSZ"},"agent_actions":{"view_html":"https://pith.science/pith/OHMSFPSZHXSCWXL6MFAOSJKRBP","download_json":"https://pith.science/pith/OHMSFPSZHXSCWXL6MFAOSJKRBP.json","view_paper":"https://pith.science/paper/OHMSFPSZ","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2412.07119&json=true","fetch_graph":"https://pith.science/api/pith-number/OHMSFPSZHXSCWXL6MFAOSJKRBP/graph.json","fetch_events":"https://pith.science/api/pith-number/OHMSFPSZHXSCWXL6MFAOSJKRBP/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/OHMSFPSZHXSCWXL6MFAOSJKRBP/action/timestamp_anchor","attest_storage":"https://pith.science/pith/OHMSFPSZHXSCWXL6MFAOSJKRBP/action/storage_attestation","attest_author":"https://pith.science/pith/OHMSFPSZHXSCWXL6MFAOSJKRBP/action/author_attestation","sign_citation":"https://pith.science/pith/OHMSFPSZHXSCWXL6MFAOSJKRBP/action/citation_signature","submit_replication":"https://pith.science/pith/OHMSFPSZHXSCWXL6MFAOSJKRBP/action/replication_record"}},"created_at":"2026-07-05T09:47:04.251616+00:00","updated_at":"2026-07-05T09:47:04.251616+00:00"}