{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:5LCYUPSTCTDBUNZ7MUKECYJ5IL","short_pith_number":"pith:5LCYUPST","schema_version":"1.0","canonical_sha256":"eac58a3e5314c61a373f651441613d42d2d8908b38dcedbcb4c26330314057a2","source":{"kind":"arxiv","id":"2311.18799","version":2},"attestation_state":"computed","paper":{"title":"X-InstructBLIP: A Framework for aligning X-Modal instruction-aware representations to LLMs and Emergent Cross-modal Reasoning","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.CV","authors_text":"Artemis Panagopoulou, Caiming Xiong, Dongxu Li, Juan Carlos Niebles, Junnan Li, Le Xue, Ning Yu, Ran Xu, Shafiq Joty, Silvio Savarese","submitted_at":"2023-11-30T18:43:51Z","abstract_excerpt":"Recent research has achieved significant advancements in visual reasoning tasks through learning image-to-language projections and leveraging the impressive reasoning abilities of Large Language Models (LLMs). This paper introduces an efficient and effective framework that integrates multiple modalities (images, 3D, audio and video) to a frozen LLM and demonstrates an emergent ability for cross-modal reasoning (2+ modality inputs). Our approach explores two distinct projection mechanisms: Q-Formers and Linear Projections (LPs). Through extensive experimentation across all four modalities on 16"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2311.18799","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"cs.CV","submitted_at":"2023-11-30T18:43:51Z","cross_cats_sorted":["cs.CL"],"title_canon_sha256":"230e68c824e109942c87554e45dc7ccfd10154f02e0b9862acef021442d46cd8","abstract_canon_sha256":"786b04a60b80ffc4a31ba6c2a78c2ff99c9147751e4c052cabf9a4416201e9c8"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:04:30.692772Z","signature_b64":"+K2C/libG/68QM06s3+MF4BTZaOgmOYcauvHkK8orXdeOAl8CCs8DZNPN4gMt9CYw9RmAAY9xQ0ITsMYlUgpDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"eac58a3e5314c61a373f651441613d42d2d8908b38dcedbcb4c26330314057a2","last_reissued_at":"2026-07-05T09:04:30.692282Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:04:30.692282Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"X-InstructBLIP: A Framework for aligning X-Modal instruction-aware representations to LLMs and Emergent Cross-modal Reasoning","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.CV","authors_text":"Artemis Panagopoulou, Caiming Xiong, Dongxu Li, Juan Carlos Niebles, Junnan Li, Le Xue, Ning Yu, Ran Xu, Shafiq Joty, Silvio Savarese","submitted_at":"2023-11-30T18:43:51Z","abstract_excerpt":"Recent research has achieved significant advancements in visual reasoning tasks through learning image-to-language projections and leveraging the impressive reasoning abilities of Large Language Models (LLMs). This paper introduces an efficient and effective framework that integrates multiple modalities (images, 3D, audio and video) to a frozen LLM and demonstrates an emergent ability for cross-modal reasoning (2+ modality inputs). Our approach explores two distinct projection mechanisms: Q-Formers and Linear Projections (LPs). Through extensive experimentation across all four modalities on 16"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2311.18799","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2311.18799/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2311.18799","created_at":"2026-07-05T09:04:30.692349+00:00"},{"alias_kind":"arxiv_version","alias_value":"2311.18799v2","created_at":"2026-07-05T09:04:30.692349+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2311.18799","created_at":"2026-07-05T09:04:30.692349+00:00"},{"alias_kind":"pith_short_12","alias_value":"5LCYUPSTCTDB","created_at":"2026-07-05T09:04:30.692349+00:00"},{"alias_kind":"pith_short_16","alias_value":"5LCYUPSTCTDBUNZ7","created_at":"2026-07-05T09:04:30.692349+00:00"},{"alias_kind":"pith_short_8","alias_value":"5LCYUPST","created_at":"2026-07-05T09:04:30.692349+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":7,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.21949","citing_title":"CapRiCorn-1K: A Comprehensive Benchmark for Video Captioning and Subject Referential Consistency Across Temporal Scales","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2606.07289","citing_title":"Closed-Form Spectral Regularization for Multi-Task Model Merging","ref_index":97,"is_internal_anchor":false},{"citing_arxiv_id":"2412.13050","citing_title":"Modality-Inconsistent Continual Learning of Multimodal Large Language Models","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2502.04326","citing_title":"WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs","ref_index":54,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11605","citing_title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","ref_index":34,"is_internal_anchor":false},{"citing_arxiv_id":"2406.07476","citing_title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","ref_index":37,"is_internal_anchor":false},{"citing_arxiv_id":"2501.13106","citing_title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","ref_index":160,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/5LCYUPSTCTDBUNZ7MUKECYJ5IL","json":"https://pith.science/pith/5LCYUPSTCTDBUNZ7MUKECYJ5IL.json","graph_json":"https://pith.science/api/pith-number/5LCYUPSTCTDBUNZ7MUKECYJ5IL/graph.json","events_json":"https://pith.science/api/pith-number/5LCYUPSTCTDBUNZ7MUKECYJ5IL/events.json","paper":"https://pith.science/paper/5LCYUPST"},"agent_actions":{"view_html":"https://pith.science/pith/5LCYUPSTCTDBUNZ7MUKECYJ5IL","download_json":"https://pith.science/pith/5LCYUPSTCTDBUNZ7MUKECYJ5IL.json","view_paper":"https://pith.science/paper/5LCYUPST","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2311.18799&json=true","fetch_graph":"https://pith.science/api/pith-number/5LCYUPSTCTDBUNZ7MUKECYJ5IL/graph.json","fetch_events":"https://pith.science/api/pith-number/5LCYUPSTCTDBUNZ7MUKECYJ5IL/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/5LCYUPSTCTDBUNZ7MUKECYJ5IL/action/timestamp_anchor","attest_storage":"https://pith.science/pith/5LCYUPSTCTDBUNZ7MUKECYJ5IL/action/storage_attestation","attest_author":"https://pith.science/pith/5LCYUPSTCTDBUNZ7MUKECYJ5IL/action/author_attestation","sign_citation":"https://pith.science/pith/5LCYUPSTCTDBUNZ7MUKECYJ5IL/action/citation_signature","submit_replication":"https://pith.science/pith/5LCYUPSTCTDBUNZ7MUKECYJ5IL/action/replication_record"}},"created_at":"2026-07-05T09:04:30.692349+00:00","updated_at":"2026-07-05T09:04:30.692349+00:00"}