{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:LXS3VP5WGNEFKYHKBNXC2GX2IM","short_pith_number":"pith:LXS3VP5W","schema_version":"1.0","canonical_sha256":"5de5babfb633485560ea0b6e2d1afa433dff9639a0fb310832e3fbc07c4ceaca","source":{"kind":"arxiv","id":"2502.05091","version":2},"attestation_state":"computed","paper":{"title":"DCFormer: Efficient 3D Vision-Language Modeling with Decomposed Convolutions","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Gorkem Can Ates, Kuang Gong, Wei Shao, Yu Xin","submitted_at":"2025-02-07T17:10:22Z","abstract_excerpt":"Vision-language models (VLMs) have been widely applied to 2D medical image analysis due to their ability to align visual and textual representations. However, extending VLMs to 3D imaging remains computationally challenging. Existing 3D VLMs often rely on Vision Transformers (ViTs), which are computationally expensive due to the quadratic complexity of self-attention, or on 3D convolutions, which require large numbers of parameters and FLOPs as kernel size increases. We introduce DCFormer, an efficient 3D image encoder that factorizes 3D convolutions into three parallel 1D convolutions along t"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2502.05091","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"cs.CV","submitted_at":"2025-02-07T17:10:22Z","cross_cats_sorted":[],"title_canon_sha256":"1ed073b957cce208765c99abaaaf128bbebb6e7700198f0fe6e5c1f6feed7c6a","abstract_canon_sha256":"9d0b11e5a2d417a5a872dd243a177e3fddaaa62b0ff1057ee61c67dcbceeb732"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:53:52.242900Z","signature_b64":"0F2d1pD72YERkn22R7i35h75pgGq1rOu/PBbAOZwOCMnVBxepU0vp6xze8tTtLSyrjT26WXXe0oVLWULfReRDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"5de5babfb633485560ea0b6e2d1afa433dff9639a0fb310832e3fbc07c4ceaca","last_reissued_at":"2026-07-05T10:53:52.242307Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:53:52.242307Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"DCFormer: Efficient 3D Vision-Language Modeling with Decomposed Convolutions","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Gorkem Can Ates, Kuang Gong, Wei Shao, Yu Xin","submitted_at":"2025-02-07T17:10:22Z","abstract_excerpt":"Vision-language models (VLMs) have been widely applied to 2D medical image analysis due to their ability to align visual and textual representations. However, extending VLMs to 3D imaging remains computationally challenging. Existing 3D VLMs often rely on Vision Transformers (ViTs), which are computationally expensive due to the quadratic complexity of self-attention, or on 3D convolutions, which require large numbers of parameters and FLOPs as kernel size increases. We introduce DCFormer, an efficient 3D image encoder that factorizes 3D convolutions into three parallel 1D convolutions along t"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2502.05091","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2502.05091/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2502.05091","created_at":"2026-07-05T10:53:52.242377+00:00"},{"alias_kind":"arxiv_version","alias_value":"2502.05091v2","created_at":"2026-07-05T10:53:52.242377+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2502.05091","created_at":"2026-07-05T10:53:52.242377+00:00"},{"alias_kind":"pith_short_12","alias_value":"LXS3VP5WGNEF","created_at":"2026-07-05T10:53:52.242377+00:00"},{"alias_kind":"pith_short_16","alias_value":"LXS3VP5WGNEFKYHK","created_at":"2026-07-05T10:53:52.242377+00:00"},{"alias_kind":"pith_short_8","alias_value":"LXS3VP5W","created_at":"2026-07-05T10:53:52.242377+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":3,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.17140","citing_title":"UCSF-PDGM-VQA: Visual Question Answering dataset for brain tumor MRI interpretation","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17140","citing_title":"UCSF-PDGM-VQA: Visual Question Answering dataset for brain tumor MRI interpretation","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2604.24876","citing_title":"ESICA: A Scalable Framework for Text-Guided 3D Medical Image Segmentation","ref_index":9,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/LXS3VP5WGNEFKYHKBNXC2GX2IM","json":"https://pith.science/pith/LXS3VP5WGNEFKYHKBNXC2GX2IM.json","graph_json":"https://pith.science/api/pith-number/LXS3VP5WGNEFKYHKBNXC2GX2IM/graph.json","events_json":"https://pith.science/api/pith-number/LXS3VP5WGNEFKYHKBNXC2GX2IM/events.json","paper":"https://pith.science/paper/LXS3VP5W"},"agent_actions":{"view_html":"https://pith.science/pith/LXS3VP5WGNEFKYHKBNXC2GX2IM","download_json":"https://pith.science/pith/LXS3VP5WGNEFKYHKBNXC2GX2IM.json","view_paper":"https://pith.science/paper/LXS3VP5W","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2502.05091&json=true","fetch_graph":"https://pith.science/api/pith-number/LXS3VP5WGNEFKYHKBNXC2GX2IM/graph.json","fetch_events":"https://pith.science/api/pith-number/LXS3VP5WGNEFKYHKBNXC2GX2IM/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/LXS3VP5WGNEFKYHKBNXC2GX2IM/action/timestamp_anchor","attest_storage":"https://pith.science/pith/LXS3VP5WGNEFKYHKBNXC2GX2IM/action/storage_attestation","attest_author":"https://pith.science/pith/LXS3VP5WGNEFKYHKBNXC2GX2IM/action/author_attestation","sign_citation":"https://pith.science/pith/LXS3VP5WGNEFKYHKBNXC2GX2IM/action/citation_signature","submit_replication":"https://pith.science/pith/LXS3VP5WGNEFKYHKBNXC2GX2IM/action/replication_record"}},"created_at":"2026-07-05T10:53:52.242377+00:00","updated_at":"2026-07-05T10:53:52.242377+00:00"}