{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:HHU7C2OOMRNG2BVWYCCSPTF6NO","short_pith_number":"pith:HHU7C2OO","schema_version":"1.0","canonical_sha256":"39e9f169ce645a6d06b6c08527ccbe6b8297a5bc3092419579cacd256a7e208c","source":{"kind":"arxiv","id":"2407.16364","version":2},"attestation_state":"computed","paper":{"title":"Harmonizing Visual Text Comprehension and Generation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Binghong Wu, Can Huang, Chunhui Lin, Hao Liu, Jingqun Tang, Shu Wei, Xin Tan, Yuan Xie, Zhen Zhao, Zhizhong Zhang","submitted_at":"2024-07-23T10:11:56Z","abstract_excerpt":"In this work, we present TextHarmony, a unified and versatile multimodal generative model proficient in comprehending and generating visual text. Simultaneously generating images and texts typically results in performance degradation due to the inherent inconsistency between vision and language modalities. To overcome this challenge, existing approaches resort to modality-specific data for supervised fine-tuning, necessitating distinct model instances. We propose Slide-LoRA, which dynamically aggregates modality-specific and modality-agnostic LoRA experts, partially decoupling the multimodal g"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2407.16364","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2024-07-23T10:11:56Z","cross_cats_sorted":[],"title_canon_sha256":"450c974ed88cc257fea4a5e075dda62ad94a55cbc98ceabcac66482cc7b781f8","abstract_canon_sha256":"ac159c3fafdd7ed672aa62db12c1099d9c36c41897586384adcc605d24b5f07b"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:24:37.107902Z","signature_b64":"a26E19d3sNN0ngifMBsiehGQeb1urR+q0Rsr24is0sNi9l3uxpLZCTsDRdKn5nXNR9tLRVFpMdpj6mygpkODAQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"39e9f169ce645a6d06b6c08527ccbe6b8297a5bc3092419579cacd256a7e208c","last_reissued_at":"2026-07-05T09:24:37.107374Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:24:37.107374Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Harmonizing Visual Text Comprehension and Generation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Binghong Wu, Can Huang, Chunhui Lin, Hao Liu, Jingqun Tang, Shu Wei, Xin Tan, Yuan Xie, Zhen Zhao, Zhizhong Zhang","submitted_at":"2024-07-23T10:11:56Z","abstract_excerpt":"In this work, we present TextHarmony, a unified and versatile multimodal generative model proficient in comprehending and generating visual text. Simultaneously generating images and texts typically results in performance degradation due to the inherent inconsistency between vision and language modalities. To overcome this challenge, existing approaches resort to modality-specific data for supervised fine-tuning, necessitating distinct model instances. We propose Slide-LoRA, which dynamically aggregates modality-specific and modality-agnostic LoRA experts, partially decoupling the multimodal g"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2407.16364","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2407.16364/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2407.16364","created_at":"2026-07-05T09:24:37.107430+00:00"},{"alias_kind":"arxiv_version","alias_value":"2407.16364v2","created_at":"2026-07-05T09:24:37.107430+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2407.16364","created_at":"2026-07-05T09:24:37.107430+00:00"},{"alias_kind":"pith_short_12","alias_value":"HHU7C2OOMRNG","created_at":"2026-07-05T09:24:37.107430+00:00"},{"alias_kind":"pith_short_16","alias_value":"HHU7C2OOMRNG2BVW","created_at":"2026-07-05T09:24:37.107430+00:00"},{"alias_kind":"pith_short_8","alias_value":"HHU7C2OO","created_at":"2026-07-05T09:24:37.107430+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":4,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2607.01602","citing_title":"ProWAFT: A ROMA-LPD Instance for Workload-Aware and Dynamic Fault Tolerance in FPGA-Based CNN Accelerators","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2606.30189","citing_title":"DAIN: Dynamic Agent-Based Interaction Network for Efficient and Collaborative Multimodal Reasoning","ref_index":87,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18173","citing_title":"Do You Need Text Rectification? Soft Attention Mask Embedding for Rectification-Free Scene Text Spotting","ref_index":34,"is_internal_anchor":false},{"citing_arxiv_id":"2604.03339","citing_title":"Hierarchical Awareness Adapters with Hybrid Pyramid Feature Fusion for Dense Depth Prediction","ref_index":71,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/HHU7C2OOMRNG2BVWYCCSPTF6NO","json":"https://pith.science/pith/HHU7C2OOMRNG2BVWYCCSPTF6NO.json","graph_json":"https://pith.science/api/pith-number/HHU7C2OOMRNG2BVWYCCSPTF6NO/graph.json","events_json":"https://pith.science/api/pith-number/HHU7C2OOMRNG2BVWYCCSPTF6NO/events.json","paper":"https://pith.science/paper/HHU7C2OO"},"agent_actions":{"view_html":"https://pith.science/pith/HHU7C2OOMRNG2BVWYCCSPTF6NO","download_json":"https://pith.science/pith/HHU7C2OOMRNG2BVWYCCSPTF6NO.json","view_paper":"https://pith.science/paper/HHU7C2OO","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2407.16364&json=true","fetch_graph":"https://pith.science/api/pith-number/HHU7C2OOMRNG2BVWYCCSPTF6NO/graph.json","fetch_events":"https://pith.science/api/pith-number/HHU7C2OOMRNG2BVWYCCSPTF6NO/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/HHU7C2OOMRNG2BVWYCCSPTF6NO/action/timestamp_anchor","attest_storage":"https://pith.science/pith/HHU7C2OOMRNG2BVWYCCSPTF6NO/action/storage_attestation","attest_author":"https://pith.science/pith/HHU7C2OOMRNG2BVWYCCSPTF6NO/action/author_attestation","sign_citation":"https://pith.science/pith/HHU7C2OOMRNG2BVWYCCSPTF6NO/action/citation_signature","submit_replication":"https://pith.science/pith/HHU7C2OOMRNG2BVWYCCSPTF6NO/action/replication_record"}},"created_at":"2026-07-05T09:24:37.107430+00:00","updated_at":"2026-07-05T09:24:37.107430+00:00"}