{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:3Q3HSJ5UHYGKTPWISD7GFKOVCX","short_pith_number":"pith:3Q3HSJ5U","schema_version":"1.0","canonical_sha256":"dc367927b43e0ca9bec890fe62a9d515edf1e0b17464f336506b4b2047f942ba","source":{"kind":"arxiv","id":"2502.18778","version":3},"attestation_state":"computed","paper":{"title":"M2-omni: Advancing Omni-MLLM for Comprehensive Modality Support with Competitive Performance","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.LG","authors_text":"Jingdong Chen, Jun Zhou, Kaiyou Song, Ming Yang, Qinglong Zhang, Qingpei Guo, Sirui Gao, Tai-Wei Chang, Xuzheng Yu, Yunxiao Sun, Zipeng Feng, Ziping Ma","submitted_at":"2025-02-26T03:21:12Z","abstract_excerpt":"We present M2-omni, a cutting-edge, open-source omni-MLLM that achieves competitive performance to GPT-4o. M2-omni employs a unified multimodal sequence modeling framework, which empowers Large Language Models(LLMs) to acquire comprehensive cross-modal understanding and generation capabilities. Specifically, M2-omni can process arbitrary combinations of audio, video, image, and text modalities as input, generating multimodal sequences interleaving with audio, image, or text outputs, thereby enabling an advanced and interactive real-time experience. The training of such an omni-MLLM is challeng"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2502.18778","kind":"arxiv","version":3},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2025-02-26T03:21:12Z","cross_cats_sorted":["cs.AI","cs.CL"],"title_canon_sha256":"1172691612d698a88aaeb9335cf51d041da7d1eb3b10bd7cd4952a56f9cbdb0d","abstract_canon_sha256":"343d9a38dce118885bc886c6a5e63ee9291836aa3e70e1d80ff969d87367b95f"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:45:17.576290Z","signature_b64":"gRnA4cyOCfFS5+rnOUZcKS/QksfVckqCqx2GNpMlNC4K0LIAGkOTE0jYiCGZbC44ZoAdvkn2lrUcZzo3Rx+1Bw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"dc367927b43e0ca9bec890fe62a9d515edf1e0b17464f336506b4b2047f942ba","last_reissued_at":"2026-07-05T10:45:17.575760Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:45:17.575760Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"M2-omni: Advancing Omni-MLLM for Comprehensive Modality Support with Competitive Performance","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.LG","authors_text":"Jingdong Chen, Jun Zhou, Kaiyou Song, Ming Yang, Qinglong Zhang, Qingpei Guo, Sirui Gao, Tai-Wei Chang, Xuzheng Yu, Yunxiao Sun, Zipeng Feng, Ziping Ma","submitted_at":"2025-02-26T03:21:12Z","abstract_excerpt":"We present M2-omni, a cutting-edge, open-source omni-MLLM that achieves competitive performance to GPT-4o. M2-omni employs a unified multimodal sequence modeling framework, which empowers Large Language Models(LLMs) to acquire comprehensive cross-modal understanding and generation capabilities. Specifically, M2-omni can process arbitrary combinations of audio, video, image, and text modalities as input, generating multimodal sequences interleaving with audio, image, or text outputs, thereby enabling an advanced and interactive real-time experience. The training of such an omni-MLLM is challeng"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2502.18778","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2502.18778/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2502.18778","created_at":"2026-07-05T10:45:17.575821+00:00"},{"alias_kind":"arxiv_version","alias_value":"2502.18778v3","created_at":"2026-07-05T10:45:17.575821+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2502.18778","created_at":"2026-07-05T10:45:17.575821+00:00"},{"alias_kind":"pith_short_12","alias_value":"3Q3HSJ5UHYGK","created_at":"2026-07-05T10:45:17.575821+00:00"},{"alias_kind":"pith_short_16","alias_value":"3Q3HSJ5UHYGKTPWI","created_at":"2026-07-05T10:45:17.575821+00:00"},{"alias_kind":"pith_short_8","alias_value":"3Q3HSJ5U","created_at":"2026-07-05T10:45:17.575821+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":7,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.25325","citing_title":"Omni-Perception Policy Optimization for Multimodal Emotion Reasoning","ref_index":85,"is_internal_anchor":false},{"citing_arxiv_id":"2606.17296","citing_title":"Pareto LoRA: Mitigating Modality Imbalance in Unified Multimodal Models via Pareto-Optimal Gradient Integration","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2606.00959","citing_title":"Towards Understanding Modality Interaction in Multimodal Language Models via Partial Information Decomposition","ref_index":41,"is_internal_anchor":false},{"citing_arxiv_id":"2508.10016","citing_title":"Training-Free Multimodal Large Language Model Orchestration","ref_index":58,"is_internal_anchor":false},{"citing_arxiv_id":"2508.10016","citing_title":"Training-Free Multimodal Large Language Model Orchestration","ref_index":58,"is_internal_anchor":false},{"citing_arxiv_id":"2605.07593","citing_title":"TraceAV-Bench: Benchmarking Multi-Hop Trajectory Reasoning over Long Audio-Visual Videos","ref_index":50,"is_internal_anchor":false},{"citing_arxiv_id":"2604.05522","citing_title":"Cross-Modal Coreference Alignment: Enabling Reliable Information Transfer in Omni-LLMs","ref_index":1,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/3Q3HSJ5UHYGKTPWISD7GFKOVCX","json":"https://pith.science/pith/3Q3HSJ5UHYGKTPWISD7GFKOVCX.json","graph_json":"https://pith.science/api/pith-number/3Q3HSJ5UHYGKTPWISD7GFKOVCX/graph.json","events_json":"https://pith.science/api/pith-number/3Q3HSJ5UHYGKTPWISD7GFKOVCX/events.json","paper":"https://pith.science/paper/3Q3HSJ5U"},"agent_actions":{"view_html":"https://pith.science/pith/3Q3HSJ5UHYGKTPWISD7GFKOVCX","download_json":"https://pith.science/pith/3Q3HSJ5UHYGKTPWISD7GFKOVCX.json","view_paper":"https://pith.science/paper/3Q3HSJ5U","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2502.18778&json=true","fetch_graph":"https://pith.science/api/pith-number/3Q3HSJ5UHYGKTPWISD7GFKOVCX/graph.json","fetch_events":"https://pith.science/api/pith-number/3Q3HSJ5UHYGKTPWISD7GFKOVCX/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/3Q3HSJ5UHYGKTPWISD7GFKOVCX/action/timestamp_anchor","attest_storage":"https://pith.science/pith/3Q3HSJ5UHYGKTPWISD7GFKOVCX/action/storage_attestation","attest_author":"https://pith.science/pith/3Q3HSJ5UHYGKTPWISD7GFKOVCX/action/author_attestation","sign_citation":"https://pith.science/pith/3Q3HSJ5UHYGKTPWISD7GFKOVCX/action/citation_signature","submit_replication":"https://pith.science/pith/3Q3HSJ5UHYGKTPWISD7GFKOVCX/action/replication_record"}},"created_at":"2026-07-05T10:45:17.575821+00:00","updated_at":"2026-07-05T10:45:17.575821+00:00"}