{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:TLPCO3QQRNNSF6TMTJL7WZFUPO","short_pith_number":"pith:TLPCO3QQ","schema_version":"1.0","canonical_sha256":"9ade276e108b5b22fa6c9a57fb64b47b8bb42ff19d360f8f2c0e13d150afb16f","source":{"kind":"arxiv","id":"2402.05935","version":3},"attestation_state":"computed","paper":{"title":"SPHINX-X: Scaling Data and Parameters for a Family of Multi-modal Large Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CL","cs.LG"],"primary_cat":"cs.CV","authors_text":"Chao Xu, Conghui He, Dongyang Liu, Hao Shao, Hongsheng Li, Junjun He, Kaipeng Zhang, Longtian Qiu, Pan Lu, Peng Gao, Peng Jin, Renrui Zhang, Shijie Geng, Shitian Zhao, Siyuan Huang, Weifeng Lin, Wenqi Shao, Yu Qiao, Ziyi Lin","submitted_at":"2024-02-08T18:59:48Z","abstract_excerpt":"We propose SPHINX-X, an extensive Multimodality Large Language Model (MLLM) series developed upon SPHINX. To improve the architecture and training efficiency, we modify the SPHINX framework by removing redundant visual encoders, bypassing fully-padded sub-images with skip tokens, and simplifying multi-stage training into a one-stage all-in-one paradigm. To fully unleash the potential of MLLMs, we assemble a comprehensive multi-domain and multimodal dataset covering publicly available resources in language, vision, and vision-language tasks. We further enrich this collection with our curated OC"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2402.05935","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2024-02-08T18:59:48Z","cross_cats_sorted":["cs.AI","cs.CL","cs.LG"],"title_canon_sha256":"8df2dd1f48d18b1b322c199ebd5af8ce4a845e61977f97c7c2850e12366c621c","abstract_canon_sha256":"c51bdeb8ee03f579b587d46af160212808f882514d178fb73be2e539e22382a2"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:36:23.867581Z","signature_b64":"ZW3G1Js0JKjYeWZZjoBQeU5fWbKjS2zVoUNrpK9tLcXW+stx+VuNQdkKJon19BbuaWLpZBNs2ouqZc5PattwDg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"9ade276e108b5b22fa6c9a57fb64b47b8bb42ff19d360f8f2c0e13d150afb16f","last_reissued_at":"2026-07-05T10:36:23.866576Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:36:23.866576Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"SPHINX-X: Scaling Data and Parameters for a Family of Multi-modal Large Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CL","cs.LG"],"primary_cat":"cs.CV","authors_text":"Chao Xu, Conghui He, Dongyang Liu, Hao Shao, Hongsheng Li, Junjun He, Kaipeng Zhang, Longtian Qiu, Pan Lu, Peng Gao, Peng Jin, Renrui Zhang, Shijie Geng, Shitian Zhao, Siyuan Huang, Weifeng Lin, Wenqi Shao, Yu Qiao, Ziyi Lin","submitted_at":"2024-02-08T18:59:48Z","abstract_excerpt":"We propose SPHINX-X, an extensive Multimodality Large Language Model (MLLM) series developed upon SPHINX. To improve the architecture and training efficiency, we modify the SPHINX framework by removing redundant visual encoders, bypassing fully-padded sub-images with skip tokens, and simplifying multi-stage training into a one-stage all-in-one paradigm. To fully unleash the potential of MLLMs, we assemble a comprehensive multi-domain and multimodal dataset covering publicly available resources in language, vision, and vision-language tasks. We further enrich this collection with our curated OC"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2402.05935","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2402.05935/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2402.05935","created_at":"2026-07-05T10:36:23.866719+00:00"},{"alias_kind":"arxiv_version","alias_value":"2402.05935v3","created_at":"2026-07-05T10:36:23.866719+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2402.05935","created_at":"2026-07-05T10:36:23.866719+00:00"},{"alias_kind":"pith_short_12","alias_value":"TLPCO3QQRNNS","created_at":"2026-07-05T10:36:23.866719+00:00"},{"alias_kind":"pith_short_16","alias_value":"TLPCO3QQRNNSF6TM","created_at":"2026-07-05T10:36:23.866719+00:00"},{"alias_kind":"pith_short_8","alias_value":"TLPCO3QQ","created_at":"2026-07-05T10:36:23.866719+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":17,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.26196","citing_title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2606.21734","citing_title":"HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning","ref_index":289,"is_internal_anchor":false},{"citing_arxiv_id":"2606.21337","citing_title":"DataClaw0: Agentic Tailoring Multimodal Data from Raw Streams","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2606.00275","citing_title":"Hyperbolic and Evidence-Prioritized Experts for Large Vision-Language Models","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2503.16549","citing_title":"MathFlow: Enhancing the Perceptual Flow of MLLMs for Visual Mathematical Problems","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2510.21122","citing_title":"NoisyGRPO: Incentivizing Multimodal CoT Reasoning via Noise Injection and Bayesian Estimation","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2412.14164","citing_title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","ref_index":175,"is_internal_anchor":false},{"citing_arxiv_id":"2403.00476","citing_title":"TempCompass: Do Video LLMs Really Understand Videos?","ref_index":83,"is_internal_anchor":false},{"citing_arxiv_id":"2403.14624","citing_title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2406.16860","citing_title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","ref_index":46,"is_internal_anchor":false},{"citing_arxiv_id":"2403.09611","citing_title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2603.09921","citing_title":"WikiCLIP: An Efficient Contrastive Baseline for Open-domain Visual Entity Recognition","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2303.16199","citing_title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","ref_index":112,"is_internal_anchor":false},{"citing_arxiv_id":"2403.20330","citing_title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2604.08719","citing_title":"LMGenDrive: Bridging Multimodal Understanding and Generative World Modeling for End-to-End Driving","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2407.07895","citing_title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2604.14629","citing_title":"Switch-KD: Visual-Switch Knowledge Distillation for Vision-Language Models","ref_index":29,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/TLPCO3QQRNNSF6TMTJL7WZFUPO","json":"https://pith.science/pith/TLPCO3QQRNNSF6TMTJL7WZFUPO.json","graph_json":"https://pith.science/api/pith-number/TLPCO3QQRNNSF6TMTJL7WZFUPO/graph.json","events_json":"https://pith.science/api/pith-number/TLPCO3QQRNNSF6TMTJL7WZFUPO/events.json","paper":"https://pith.science/paper/TLPCO3QQ"},"agent_actions":{"view_html":"https://pith.science/pith/TLPCO3QQRNNSF6TMTJL7WZFUPO","download_json":"https://pith.science/pith/TLPCO3QQRNNSF6TMTJL7WZFUPO.json","view_paper":"https://pith.science/paper/TLPCO3QQ","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2402.05935&json=true","fetch_graph":"https://pith.science/api/pith-number/TLPCO3QQRNNSF6TMTJL7WZFUPO/graph.json","fetch_events":"https://pith.science/api/pith-number/TLPCO3QQRNNSF6TMTJL7WZFUPO/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/TLPCO3QQRNNSF6TMTJL7WZFUPO/action/timestamp_anchor","attest_storage":"https://pith.science/pith/TLPCO3QQRNNSF6TMTJL7WZFUPO/action/storage_attestation","attest_author":"https://pith.science/pith/TLPCO3QQRNNSF6TMTJL7WZFUPO/action/author_attestation","sign_citation":"https://pith.science/pith/TLPCO3QQRNNSF6TMTJL7WZFUPO/action/citation_signature","submit_replication":"https://pith.science/pith/TLPCO3QQRNNSF6TMTJL7WZFUPO/action/replication_record"}},"created_at":"2026-07-05T10:36:23.866719+00:00","updated_at":"2026-07-05T10:36:23.866719+00:00"}