{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:VLX4NSKRNYN5XOG74IUTRA3JR3","short_pith_number":"pith:VLX4NSKR","schema_version":"1.0","canonical_sha256":"aaefc6c9516e1bdbb8dfe2293883698ec0dedecc4ab570cf755b7db9f1cf4e30","source":{"kind":"arxiv","id":"2504.21682","version":2},"attestation_state":"computed","paper":{"title":"Visual Text Processing: A Comprehensive Review and Unified Evaluation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Fangmin Zhao, Lianwen Jin, Nicu Sebe, Paolo Rota, Weichao Zeng, Xiang Bai, Xiaomeng Yang, Xu-Cheng Yin, Yan Shu, Yu Zhou, Zeyu Chen, Zhenhang Li","submitted_at":"2025-04-30T14:19:29Z","abstract_excerpt":"Visual text is a crucial component in both document and scene images, conveying rich semantic information and attracting significant attention in the computer vision community. Beyond traditional tasks such as text detection and recognition, visual text processing has witnessed rapid advancements driven by the emergence of foundation models, including text image reconstruction and text image manipulation. Despite significant progress, challenges remain due to the unique properties that differentiate text from general objects. Effectively capturing and leveraging these distinct textual characte"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2504.21682","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2025-04-30T14:19:29Z","cross_cats_sorted":[],"title_canon_sha256":"30fb6b84e9dc6b165d8af11f0594e47d9ca681b15aac6c22c57d9cc4e10912c8","abstract_canon_sha256":"ed4a7cf8611029b517580d4365a46036dfb50405949f25987a4b3124c5084a5a"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:16:57.916884Z","signature_b64":"b6j3bkLqu0jLFcA86Z2GczCYCLb+fNc1b0rNZ2LbktiLA/ijjvTmPj36hk2WQI8VhHCmkVPUKxzBVzMRFvFXAQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"aaefc6c9516e1bdbb8dfe2293883698ec0dedecc4ab570cf755b7db9f1cf4e30","last_reissued_at":"2026-07-05T11:16:57.916384Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:16:57.916384Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Visual Text Processing: A Comprehensive Review and Unified Evaluation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Fangmin Zhao, Lianwen Jin, Nicu Sebe, Paolo Rota, Weichao Zeng, Xiang Bai, Xiaomeng Yang, Xu-Cheng Yin, Yan Shu, Yu Zhou, Zeyu Chen, Zhenhang Li","submitted_at":"2025-04-30T14:19:29Z","abstract_excerpt":"Visual text is a crucial component in both document and scene images, conveying rich semantic information and attracting significant attention in the computer vision community. Beyond traditional tasks such as text detection and recognition, visual text processing has witnessed rapid advancements driven by the emergence of foundation models, including text image reconstruction and text image manipulation. Despite significant progress, challenges remain due to the unique properties that differentiate text from general objects. Effectively capturing and leveraging these distinct textual characte"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2504.21682","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2504.21682/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2504.21682","created_at":"2026-07-05T11:16:57.916444+00:00"},{"alias_kind":"arxiv_version","alias_value":"2504.21682v2","created_at":"2026-07-05T11:16:57.916444+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2504.21682","created_at":"2026-07-05T11:16:57.916444+00:00"},{"alias_kind":"pith_short_12","alias_value":"VLX4NSKRNYN5","created_at":"2026-07-05T11:16:57.916444+00:00"},{"alias_kind":"pith_short_16","alias_value":"VLX4NSKRNYN5XOG7","created_at":"2026-07-05T11:16:57.916444+00:00"},{"alias_kind":"pith_short_8","alias_value":"VLX4NSKR","created_at":"2026-07-05T11:16:57.916444+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":6,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.24333","citing_title":"UniTranslator: A Unified Multi-modal Framework for End-to-end In-Image Machine Translation","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2606.05730","citing_title":"TextWand: A Unified Framework for Scene Text Editing","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17270","citing_title":"Beyond Detection: A Structure-Aware Framework for Scene Text Tracking","ref_index":101,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14708","citing_title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","ref_index":41,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08163","citing_title":"MULTITEXTEDIT: Benchmarking Cross-Lingual Degradation in Text-in-Image Editing","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2604.09367","citing_title":"EpiAgent: An Agent-Centric System for Ancient Inscription Restoration","ref_index":23,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/VLX4NSKRNYN5XOG74IUTRA3JR3","json":"https://pith.science/pith/VLX4NSKRNYN5XOG74IUTRA3JR3.json","graph_json":"https://pith.science/api/pith-number/VLX4NSKRNYN5XOG74IUTRA3JR3/graph.json","events_json":"https://pith.science/api/pith-number/VLX4NSKRNYN5XOG74IUTRA3JR3/events.json","paper":"https://pith.science/paper/VLX4NSKR"},"agent_actions":{"view_html":"https://pith.science/pith/VLX4NSKRNYN5XOG74IUTRA3JR3","download_json":"https://pith.science/pith/VLX4NSKRNYN5XOG74IUTRA3JR3.json","view_paper":"https://pith.science/paper/VLX4NSKR","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2504.21682&json=true","fetch_graph":"https://pith.science/api/pith-number/VLX4NSKRNYN5XOG74IUTRA3JR3/graph.json","fetch_events":"https://pith.science/api/pith-number/VLX4NSKRNYN5XOG74IUTRA3JR3/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/VLX4NSKRNYN5XOG74IUTRA3JR3/action/timestamp_anchor","attest_storage":"https://pith.science/pith/VLX4NSKRNYN5XOG74IUTRA3JR3/action/storage_attestation","attest_author":"https://pith.science/pith/VLX4NSKRNYN5XOG74IUTRA3JR3/action/author_attestation","sign_citation":"https://pith.science/pith/VLX4NSKRNYN5XOG74IUTRA3JR3/action/citation_signature","submit_replication":"https://pith.science/pith/VLX4NSKRNYN5XOG74IUTRA3JR3/action/replication_record"}},"created_at":"2026-07-05T11:16:57.916444+00:00","updated_at":"2026-07-05T11:16:57.916444+00:00"}