{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:BQVAF53Q35YLZEYGF4PIYLD7EG","short_pith_number":"pith:BQVAF53Q","schema_version":"1.0","canonical_sha256":"0c2a02f770df70bc93062f1e8c2c7f2196b685474dd948ee9a65ae72ccddb3af","source":{"kind":"arxiv","id":"2412.17225","version":1},"attestation_state":"computed","paper":{"title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Jie Hu, Kai Zhou, Lichen Ma, Pei Fu, Tiezhu Yue, Xiaoming Wei, Yujie Zhong","submitted_at":"2024-12-23T02:40:07Z","abstract_excerpt":"Recently, significant advancements have been made in diffusion-based visual text generation models. Although the effectiveness of these methods in visual text rendering is rapidly improving, they still encounter challenges such as inaccurate characters and strokes when rendering complex visual text. In this paper, we propose CharGen, a highly accurate character-level visual text generation and editing model. Specifically, CharGen employs a character-level multimodal encoder that not only extracts character-level text embeddings but also encodes glyph images character by character. This enables"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2412.17225","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2024-12-23T02:40:07Z","cross_cats_sorted":[],"title_canon_sha256":"b8cddd1080f27216898876078f04ca3ae254f075ba2dc72ab8cab4e9d4f1f3dd","abstract_canon_sha256":"c0c07d6318c38c40254953443f513f4fe722f18d54157181c78b7ff96a4d20b8"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:53:19.029654Z","signature_b64":"X517SgCWEjwKJlGaWizS9JVHytaUqLft4VZEJOp1sKfNjAA0km3VmlLZ/N7WvejOHBB/Yi9R0QpwFUwSF48LBA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"0c2a02f770df70bc93062f1e8c2c7f2196b685474dd948ee9a65ae72ccddb3af","last_reissued_at":"2026-07-05T09:53:19.029141Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:53:19.029141Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Jie Hu, Kai Zhou, Lichen Ma, Pei Fu, Tiezhu Yue, Xiaoming Wei, Yujie Zhong","submitted_at":"2024-12-23T02:40:07Z","abstract_excerpt":"Recently, significant advancements have been made in diffusion-based visual text generation models. Although the effectiveness of these methods in visual text rendering is rapidly improving, they still encounter challenges such as inaccurate characters and strokes when rendering complex visual text. In this paper, we propose CharGen, a highly accurate character-level visual text generation and editing model. Specifically, CharGen employs a character-level multimodal encoder that not only extracts character-level text embeddings but also encodes glyph images character by character. This enables"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2412.17225","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2412.17225/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2412.17225","created_at":"2026-07-05T09:53:19.029199+00:00"},{"alias_kind":"arxiv_version","alias_value":"2412.17225v1","created_at":"2026-07-05T09:53:19.029199+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2412.17225","created_at":"2026-07-05T09:53:19.029199+00:00"},{"alias_kind":"pith_short_12","alias_value":"BQVAF53Q35YL","created_at":"2026-07-05T09:53:19.029199+00:00"},{"alias_kind":"pith_short_16","alias_value":"BQVAF53Q35YLZEYG","created_at":"2026-07-05T09:53:19.029199+00:00"},{"alias_kind":"pith_short_8","alias_value":"BQVAF53Q","created_at":"2026-07-05T09:53:19.029199+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":3,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2607.00920","citing_title":"GMO-E$^2$DIT: Grounded Multi-Operation Editing for E-Commerce Images","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2606.12280","citing_title":"Holding the FP8 Quality Ceiling at 8-Bit Weights and Activations: INT8 and GGUF Post-Training Quantization of Ideogram 4.0 for Consumer GPUs","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2607.00920","citing_title":"GMO-E$^2$DIT: Grounded Multi-Operation Editing for E-Commerce Images","ref_index":12,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/BQVAF53Q35YLZEYGF4PIYLD7EG","json":"https://pith.science/pith/BQVAF53Q35YLZEYGF4PIYLD7EG.json","graph_json":"https://pith.science/api/pith-number/BQVAF53Q35YLZEYGF4PIYLD7EG/graph.json","events_json":"https://pith.science/api/pith-number/BQVAF53Q35YLZEYGF4PIYLD7EG/events.json","paper":"https://pith.science/paper/BQVAF53Q"},"agent_actions":{"view_html":"https://pith.science/pith/BQVAF53Q35YLZEYGF4PIYLD7EG","download_json":"https://pith.science/pith/BQVAF53Q35YLZEYGF4PIYLD7EG.json","view_paper":"https://pith.science/paper/BQVAF53Q","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2412.17225&json=true","fetch_graph":"https://pith.science/api/pith-number/BQVAF53Q35YLZEYGF4PIYLD7EG/graph.json","fetch_events":"https://pith.science/api/pith-number/BQVAF53Q35YLZEYGF4PIYLD7EG/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/BQVAF53Q35YLZEYGF4PIYLD7EG/action/timestamp_anchor","attest_storage":"https://pith.science/pith/BQVAF53Q35YLZEYGF4PIYLD7EG/action/storage_attestation","attest_author":"https://pith.science/pith/BQVAF53Q35YLZEYGF4PIYLD7EG/action/author_attestation","sign_citation":"https://pith.science/pith/BQVAF53Q35YLZEYGF4PIYLD7EG/action/citation_signature","submit_replication":"https://pith.science/pith/BQVAF53Q35YLZEYGF4PIYLD7EG/action/replication_record"}},"created_at":"2026-07-05T09:53:19.029199+00:00","updated_at":"2026-07-05T09:53:19.029199+00:00"}