{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:QSP6PRUVKLRXG7FPQNTSTTRER3","short_pith_number":"pith:QSP6PRUV","schema_version":"1.0","canonical_sha256":"849fe7c69552e3737caf836729ce248ec621ab4246d8ac2eda156535d14000ac","source":{"kind":"arxiv","id":"2306.09093","version":1},"attestation_state":"computed","paper":{"title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.CV"],"primary_cat":"cs.CL","authors_text":"Bingshuai Liu, Chenyang Lyu, Longyue Wang, Minghao Wu, Shuming Shi, Xinting Huang, Zefeng Du, Zhaopeng Tu","submitted_at":"2023-06-15T12:45:25Z","abstract_excerpt":"Although instruction-tuned large language models (LLMs) have exhibited remarkable capabilities across various NLP tasks, their effectiveness on other data modalities beyond text has not been fully studied. In this work, we propose Macaw-LLM, a novel multi-modal LLM that seamlessly integrates visual, audio, and textual information. Macaw-LLM consists of three main components: a modality module for encoding multi-modal data, a cognitive module for harnessing pretrained LLMs, and an alignment module for harmonizing diverse representations. Our novel alignment module seamlessly bridges multi-modal"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2306.09093","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2023-06-15T12:45:25Z","cross_cats_sorted":["cs.AI","cs.CV"],"title_canon_sha256":"5b8e807f4c12b9a98570a38e22bf457556114fff4590051fcedceab2d0d4bd05","abstract_canon_sha256":"2a5296d6910aad2f98d0051243068622e5f1f5d1da09aa772f79f2cef3ad5207"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T06:21:08.527751Z","signature_b64":"I8n3ntGRbKx7LnLwR9BoI4EN8V/J5ayFy8OIQ+7tT5MfdEa7/a2hfX7kfjn2tG+p3Aqltr4J9tLILsNHVbObCQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"849fe7c69552e3737caf836729ce248ec621ab4246d8ac2eda156535d14000ac","last_reissued_at":"2026-07-05T06:21:08.527101Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T06:21:08.527101Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.CV"],"primary_cat":"cs.CL","authors_text":"Bingshuai Liu, Chenyang Lyu, Longyue Wang, Minghao Wu, Shuming Shi, Xinting Huang, Zefeng Du, Zhaopeng Tu","submitted_at":"2023-06-15T12:45:25Z","abstract_excerpt":"Although instruction-tuned large language models (LLMs) have exhibited remarkable capabilities across various NLP tasks, their effectiveness on other data modalities beyond text has not been fully studied. In this work, we propose Macaw-LLM, a novel multi-modal LLM that seamlessly integrates visual, audio, and textual information. Macaw-LLM consists of three main components: a modality module for encoding multi-modal data, a cognitive module for harnessing pretrained LLMs, and an alignment module for harmonizing diverse representations. Our novel alignment module seamlessly bridges multi-modal"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2306.09093","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2306.09093/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2306.09093","created_at":"2026-07-05T06:21:08.527187+00:00"},{"alias_kind":"arxiv_version","alias_value":"2306.09093v1","created_at":"2026-07-05T06:21:08.527187+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2306.09093","created_at":"2026-07-05T06:21:08.527187+00:00"},{"alias_kind":"pith_short_12","alias_value":"QSP6PRUVKLRX","created_at":"2026-07-05T06:21:08.527187+00:00"},{"alias_kind":"pith_short_16","alias_value":"QSP6PRUVKLRXG7FP","created_at":"2026-07-05T06:21:08.527187+00:00"},{"alias_kind":"pith_short_8","alias_value":"QSP6PRUV","created_at":"2026-07-05T06:21:08.527187+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":16,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.10533","citing_title":"Audio-Visual Exchange-Aware Token Pruning for Efficient Audio-Visual Captioning","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2606.09966","citing_title":"RespiraMFM: A Multimodal Foundation Model with Contrastive Audio-Language Alignment for Respiratory Disease Identification","ref_index":40,"is_internal_anchor":false},{"citing_arxiv_id":"2307.06435","citing_title":"A Comprehensive Overview of Large Language Models","ref_index":276,"is_internal_anchor":false},{"citing_arxiv_id":"2310.13289","citing_title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","ref_index":33,"is_internal_anchor":false},{"citing_arxiv_id":"2402.13116","citing_title":"A Survey on Knowledge Distillation of Large Language Models","ref_index":276,"is_internal_anchor":false},{"citing_arxiv_id":"2503.12937","citing_title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2311.10122","citing_title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","ref_index":114,"is_internal_anchor":false},{"citing_arxiv_id":"2604.02605","citing_title":"Do Audio-Visual Large Language Models Really See and Hear?","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10815","citing_title":"Probing Cross-modal Information Hubs in Audio-Visual LLMs","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11605","citing_title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2311.07919","citing_title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10815","citing_title":"Probing Cross-modal Information Hubs in Audio-Visual LLMs","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2604.11283","citing_title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","ref_index":177,"is_internal_anchor":false},{"citing_arxiv_id":"2406.07476","citing_title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2407.10759","citing_title":"Qwen2-Audio Technical Report","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2501.13106","citing_title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","ref_index":159,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/QSP6PRUVKLRXG7FPQNTSTTRER3","json":"https://pith.science/pith/QSP6PRUVKLRXG7FPQNTSTTRER3.json","graph_json":"https://pith.science/api/pith-number/QSP6PRUVKLRXG7FPQNTSTTRER3/graph.json","events_json":"https://pith.science/api/pith-number/QSP6PRUVKLRXG7FPQNTSTTRER3/events.json","paper":"https://pith.science/paper/QSP6PRUV"},"agent_actions":{"view_html":"https://pith.science/pith/QSP6PRUVKLRXG7FPQNTSTTRER3","download_json":"https://pith.science/pith/QSP6PRUVKLRXG7FPQNTSTTRER3.json","view_paper":"https://pith.science/paper/QSP6PRUV","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2306.09093&json=true","fetch_graph":"https://pith.science/api/pith-number/QSP6PRUVKLRXG7FPQNTSTTRER3/graph.json","fetch_events":"https://pith.science/api/pith-number/QSP6PRUVKLRXG7FPQNTSTTRER3/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/QSP6PRUVKLRXG7FPQNTSTTRER3/action/timestamp_anchor","attest_storage":"https://pith.science/pith/QSP6PRUVKLRXG7FPQNTSTTRER3/action/storage_attestation","attest_author":"https://pith.science/pith/QSP6PRUVKLRXG7FPQNTSTTRER3/action/author_attestation","sign_citation":"https://pith.science/pith/QSP6PRUVKLRXG7FPQNTSTTRER3/action/citation_signature","submit_replication":"https://pith.science/pith/QSP6PRUVKLRXG7FPQNTSTTRER3/action/replication_record"}},"created_at":"2026-07-05T06:21:08.527187+00:00","updated_at":"2026-07-05T06:21:08.527187+00:00"}