{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:3ZVSZ7U5HVOI2Z2LL54ERR2F7G","short_pith_number":"pith:3ZVSZ7U5","schema_version":"1.0","canonical_sha256":"de6b2cfe9d3d5c8d674b5f7848c745f9a8b630f9c6c1e79d7c6082120e6ea027","source":{"kind":"arxiv","id":"2408.13980","version":2},"attestation_state":"computed","paper":{"title":"FusionSAM: Visual Multi-Modal Learning with Segment Anything","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Chang Xu, Daixun Li, Leyuan Fang, Mingxiang Cao, Weiying Xie, Yunke Wang, Yunsong Li, Yusi Zhang","submitted_at":"2024-08-26T02:20:55Z","abstract_excerpt":"Multimodal image fusion and semantic segmentation are critical for autonomous driving. Despite advancements, current models often struggle with segmenting densely packed elements due to a lack of comprehensive fusion features for guidance during training. While the Segment Anything Model (SAM) allows precise control during fine-tuning through its flexible prompting encoder, its potential remains largely unexplored in the context of multimodal segmentation for natural images. In this paper, we introduce SAM into multimodal image segmentation for the first time, proposing a novel framework that "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2408.13980","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2024-08-26T02:20:55Z","cross_cats_sorted":[],"title_canon_sha256":"9e1aa20972372f3db5f4e610d651917b0f9722f1c924564095af7d9a1ce7ed2c","abstract_canon_sha256":"85b5213666e716ba9597b7292c78698b7f88d881642fc435610c7412e273ff7f"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:26:00.724400Z","signature_b64":"3wsxrPZCADjkzHztuf2BFbIFt7vC8gqti32ACR0o4kZQYi5cG9Qr32RJE48SsRW7u72t/X9BufXblXdOvVYlAQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"de6b2cfe9d3d5c8d674b5f7848c745f9a8b630f9c6c1e79d7c6082120e6ea027","last_reissued_at":"2026-07-05T11:26:00.723912Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:26:00.723912Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"FusionSAM: Visual Multi-Modal Learning with Segment Anything","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Chang Xu, Daixun Li, Leyuan Fang, Mingxiang Cao, Weiying Xie, Yunke Wang, Yunsong Li, Yusi Zhang","submitted_at":"2024-08-26T02:20:55Z","abstract_excerpt":"Multimodal image fusion and semantic segmentation are critical for autonomous driving. Despite advancements, current models often struggle with segmenting densely packed elements due to a lack of comprehensive fusion features for guidance during training. While the Segment Anything Model (SAM) allows precise control during fine-tuning through its flexible prompting encoder, its potential remains largely unexplored in the context of multimodal segmentation for natural images. In this paper, we introduce SAM into multimodal image segmentation for the first time, proposing a novel framework that "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2408.13980","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2408.13980/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2408.13980","created_at":"2026-07-05T11:26:00.723968+00:00"},{"alias_kind":"arxiv_version","alias_value":"2408.13980v2","created_at":"2026-07-05T11:26:00.723968+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2408.13980","created_at":"2026-07-05T11:26:00.723968+00:00"},{"alias_kind":"pith_short_12","alias_value":"3ZVSZ7U5HVOI","created_at":"2026-07-05T11:26:00.723968+00:00"},{"alias_kind":"pith_short_16","alias_value":"3ZVSZ7U5HVOI2Z2L","created_at":"2026-07-05T11:26:00.723968+00:00"},{"alias_kind":"pith_short_8","alias_value":"3ZVSZ7U5","created_at":"2026-07-05T11:26:00.723968+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/3ZVSZ7U5HVOI2Z2LL54ERR2F7G","json":"https://pith.science/pith/3ZVSZ7U5HVOI2Z2LL54ERR2F7G.json","graph_json":"https://pith.science/api/pith-number/3ZVSZ7U5HVOI2Z2LL54ERR2F7G/graph.json","events_json":"https://pith.science/api/pith-number/3ZVSZ7U5HVOI2Z2LL54ERR2F7G/events.json","paper":"https://pith.science/paper/3ZVSZ7U5"},"agent_actions":{"view_html":"https://pith.science/pith/3ZVSZ7U5HVOI2Z2LL54ERR2F7G","download_json":"https://pith.science/pith/3ZVSZ7U5HVOI2Z2LL54ERR2F7G.json","view_paper":"https://pith.science/paper/3ZVSZ7U5","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2408.13980&json=true","fetch_graph":"https://pith.science/api/pith-number/3ZVSZ7U5HVOI2Z2LL54ERR2F7G/graph.json","fetch_events":"https://pith.science/api/pith-number/3ZVSZ7U5HVOI2Z2LL54ERR2F7G/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/3ZVSZ7U5HVOI2Z2LL54ERR2F7G/action/timestamp_anchor","attest_storage":"https://pith.science/pith/3ZVSZ7U5HVOI2Z2LL54ERR2F7G/action/storage_attestation","attest_author":"https://pith.science/pith/3ZVSZ7U5HVOI2Z2LL54ERR2F7G/action/author_attestation","sign_citation":"https://pith.science/pith/3ZVSZ7U5HVOI2Z2LL54ERR2F7G/action/citation_signature","submit_replication":"https://pith.science/pith/3ZVSZ7U5HVOI2Z2LL54ERR2F7G/action/replication_record"}},"created_at":"2026-07-05T11:26:00.723968+00:00","updated_at":"2026-07-05T11:26:00.723968+00:00"}