{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:22DFRMUR5YDALKLKUMPWHVX4MX","short_pith_number":"pith:22DFRMUR","schema_version":"1.0","canonical_sha256":"d68658b291ee0605a96aa31f63d6fc65c4aa835f6c2349331a1f1c08223b5f4f","source":{"kind":"arxiv","id":"2508.07803","version":1},"attestation_state":"computed","paper":{"title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Haishu Tan, Huafeng Li, Xiaoqi Cheng, Xiaosong Li, Yushen Xu, Zhenyu Kuang","submitted_at":"2025-08-11T09:39:16Z","abstract_excerpt":"The goal of multimodal image fusion is to integrate complementary information from infrared and visible images, generating multimodal fused images for downstream tasks. Existing downstream pre-training models are typically trained on visible images. However, the significant pixel distribution differences between visible and multimodal fusion images can degrade downstream task performance, sometimes even below that of using only visible images. This paper explores adapting multimodal fused images with significant modality differences to object detection and semantic segmentation models trained "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2508.07803","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2025-08-11T09:39:16Z","cross_cats_sorted":[],"title_canon_sha256":"247e25770e03880dbff4b4ed95ceaf050c8361e9bea4091c65a40d3529cddcbd","abstract_canon_sha256":"aa6d983febfdb95326fc0f6a010e1307d207313d5512fc86d3a5dbab1fafac66"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:51:52.584620Z","signature_b64":"q9h9lQi509/tN8owZ+V8BRGZ91N9zdVBphxA2AQPFVKlavZuRwvvUkDHZU/ieOyA8+PFKezgpG+/gVh0pnd3Aw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"d68658b291ee0605a96aa31f63d6fc65c4aa835f6c2349331a1f1c08223b5f4f","last_reissued_at":"2026-07-05T11:51:52.584097Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:51:52.584097Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Haishu Tan, Huafeng Li, Xiaoqi Cheng, Xiaosong Li, Yushen Xu, Zhenyu Kuang","submitted_at":"2025-08-11T09:39:16Z","abstract_excerpt":"The goal of multimodal image fusion is to integrate complementary information from infrared and visible images, generating multimodal fused images for downstream tasks. Existing downstream pre-training models are typically trained on visible images. However, the significant pixel distribution differences between visible and multimodal fusion images can degrade downstream task performance, sometimes even below that of using only visible images. This paper explores adapting multimodal fused images with significant modality differences to object detection and semantic segmentation models trained "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2508.07803","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2508.07803/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2508.07803","created_at":"2026-07-05T11:51:52.584153+00:00"},{"alias_kind":"arxiv_version","alias_value":"2508.07803v1","created_at":"2026-07-05T11:51:52.584153+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2508.07803","created_at":"2026-07-05T11:51:52.584153+00:00"},{"alias_kind":"pith_short_12","alias_value":"22DFRMUR5YDA","created_at":"2026-07-05T11:51:52.584153+00:00"},{"alias_kind":"pith_short_16","alias_value":"22DFRMUR5YDALKLK","created_at":"2026-07-05T11:51:52.584153+00:00"},{"alias_kind":"pith_short_8","alias_value":"22DFRMUR","created_at":"2026-07-05T11:51:52.584153+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/22DFRMUR5YDALKLKUMPWHVX4MX","json":"https://pith.science/pith/22DFRMUR5YDALKLKUMPWHVX4MX.json","graph_json":"https://pith.science/api/pith-number/22DFRMUR5YDALKLKUMPWHVX4MX/graph.json","events_json":"https://pith.science/api/pith-number/22DFRMUR5YDALKLKUMPWHVX4MX/events.json","paper":"https://pith.science/paper/22DFRMUR"},"agent_actions":{"view_html":"https://pith.science/pith/22DFRMUR5YDALKLKUMPWHVX4MX","download_json":"https://pith.science/pith/22DFRMUR5YDALKLKUMPWHVX4MX.json","view_paper":"https://pith.science/paper/22DFRMUR","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2508.07803&json=true","fetch_graph":"https://pith.science/api/pith-number/22DFRMUR5YDALKLKUMPWHVX4MX/graph.json","fetch_events":"https://pith.science/api/pith-number/22DFRMUR5YDALKLKUMPWHVX4MX/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/22DFRMUR5YDALKLKUMPWHVX4MX/action/timestamp_anchor","attest_storage":"https://pith.science/pith/22DFRMUR5YDALKLKUMPWHVX4MX/action/storage_attestation","attest_author":"https://pith.science/pith/22DFRMUR5YDALKLKUMPWHVX4MX/action/author_attestation","sign_citation":"https://pith.science/pith/22DFRMUR5YDALKLKUMPWHVX4MX/action/citation_signature","submit_replication":"https://pith.science/pith/22DFRMUR5YDALKLKUMPWHVX4MX/action/replication_record"}},"created_at":"2026-07-05T11:51:52.584153+00:00","updated_at":"2026-07-05T11:51:52.584153+00:00"}