{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:F2GY6RTN7Q5X4QBJJWKN3M5O45","short_pith_number":"pith:F2GY6RTN","schema_version":"1.0","canonical_sha256":"2e8d8f466dfc3b7e40294d94ddb3aee76bf7d2192396dbcd3a0b8befce9b63b3","source":{"kind":"arxiv","id":"2401.10208","version":2},"attestation_state":"computed","paper":{"title":"MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.CV","authors_text":"Changyao Tian, Hongsheng Li, Jie Zhou, Jifeng Dai, Lewei Lu, Tong Lu, Weiyun Wang, Wenhai Wang, Xizhou Zhu, Yuntao Chen, Yu Qiao, Yuwen Xiong, Zhe Chen","submitted_at":"2024-01-18T18:50:16Z","abstract_excerpt":"Developing generative models for interleaved image-text data has both research and practical value. It requires models to understand the interleaved sequences and subsequently generate images and text. However, existing attempts are limited by the issue that the fixed number of visual tokens cannot efficiently capture image details, which is particularly problematic in the multi-image scenarios. To address this, this paper presents MM-Interleaved, an end-to-end generative model for interleaved image-text data. It introduces a multi-scale and multi-image feature synchronizer module, allowing di"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2401.10208","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2024-01-18T18:50:16Z","cross_cats_sorted":["cs.CL"],"title_canon_sha256":"6a20e23035f5105db9f997a2a18ae7485f6e17cf4793fdc1dc95347fac8b1535","abstract_canon_sha256":"2109cd39d487eee2fb4b06f85d5ff1fa42ef88658c12c5d3d6f23a4e8b1542fb"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:03:10.117533Z","signature_b64":"clXQ9I6XChmnYabO+g3gGLo3LBobml/d+380JHsS9Coez5KjW5wCI1T11qJ/uNrD9qxsvx+lykKX8IGTzgSDBA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"2e8d8f466dfc3b7e40294d94ddb3aee76bf7d2192396dbcd3a0b8befce9b63b3","last_reissued_at":"2026-07-05T08:03:10.117038Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:03:10.117038Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.CV","authors_text":"Changyao Tian, Hongsheng Li, Jie Zhou, Jifeng Dai, Lewei Lu, Tong Lu, Weiyun Wang, Wenhai Wang, Xizhou Zhu, Yuntao Chen, Yu Qiao, Yuwen Xiong, Zhe Chen","submitted_at":"2024-01-18T18:50:16Z","abstract_excerpt":"Developing generative models for interleaved image-text data has both research and practical value. It requires models to understand the interleaved sequences and subsequently generate images and text. However, existing attempts are limited by the issue that the fixed number of visual tokens cannot efficiently capture image details, which is particularly problematic in the multi-image scenarios. To address this, this paper presents MM-Interleaved, an end-to-end generative model for interleaved image-text data. It introduces a multi-scale and multi-image feature synchronizer module, allowing di"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2401.10208","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2401.10208/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2401.10208","created_at":"2026-07-05T08:03:10.117097+00:00"},{"alias_kind":"arxiv_version","alias_value":"2401.10208v2","created_at":"2026-07-05T08:03:10.117097+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2401.10208","created_at":"2026-07-05T08:03:10.117097+00:00"},{"alias_kind":"pith_short_12","alias_value":"F2GY6RTN7Q5X","created_at":"2026-07-05T08:03:10.117097+00:00"},{"alias_kind":"pith_short_16","alias_value":"F2GY6RTN7Q5X4QBJ","created_at":"2026-07-05T08:03:10.117097+00:00"},{"alias_kind":"pith_short_8","alias_value":"F2GY6RTN","created_at":"2026-07-05T08:03:10.117097+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":6,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.04264","citing_title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","ref_index":49,"is_internal_anchor":false},{"citing_arxiv_id":"2411.10442","citing_title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","ref_index":94,"is_internal_anchor":false},{"citing_arxiv_id":"2602.12370","citing_title":"LLaMo: Scaling Pretrained Language Models for Unified Motion Understanding and Generation with Continuous Autoregressive Tokens","ref_index":64,"is_internal_anchor":false},{"citing_arxiv_id":"2409.04429","citing_title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2404.16821","citing_title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","ref_index":110,"is_internal_anchor":false},{"citing_arxiv_id":"2412.05271","citing_title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","ref_index":233,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/F2GY6RTN7Q5X4QBJJWKN3M5O45","json":"https://pith.science/pith/F2GY6RTN7Q5X4QBJJWKN3M5O45.json","graph_json":"https://pith.science/api/pith-number/F2GY6RTN7Q5X4QBJJWKN3M5O45/graph.json","events_json":"https://pith.science/api/pith-number/F2GY6RTN7Q5X4QBJJWKN3M5O45/events.json","paper":"https://pith.science/paper/F2GY6RTN"},"agent_actions":{"view_html":"https://pith.science/pith/F2GY6RTN7Q5X4QBJJWKN3M5O45","download_json":"https://pith.science/pith/F2GY6RTN7Q5X4QBJJWKN3M5O45.json","view_paper":"https://pith.science/paper/F2GY6RTN","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2401.10208&json=true","fetch_graph":"https://pith.science/api/pith-number/F2GY6RTN7Q5X4QBJJWKN3M5O45/graph.json","fetch_events":"https://pith.science/api/pith-number/F2GY6RTN7Q5X4QBJJWKN3M5O45/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/F2GY6RTN7Q5X4QBJJWKN3M5O45/action/timestamp_anchor","attest_storage":"https://pith.science/pith/F2GY6RTN7Q5X4QBJJWKN3M5O45/action/storage_attestation","attest_author":"https://pith.science/pith/F2GY6RTN7Q5X4QBJJWKN3M5O45/action/author_attestation","sign_citation":"https://pith.science/pith/F2GY6RTN7Q5X4QBJJWKN3M5O45/action/citation_signature","submit_replication":"https://pith.science/pith/F2GY6RTN7Q5X4QBJJWKN3M5O45/action/replication_record"}},"created_at":"2026-07-05T08:03:10.117097+00:00","updated_at":"2026-07-05T08:03:10.117097+00:00"}