{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:YMTAZRD4USDEKCXCQU4UMZ6OSF","short_pith_number":"pith:YMTAZRD4","schema_version":"1.0","canonical_sha256":"c3260cc47ca486450ae285394667ce917f9bb7ad63eeedfeb2a28b0fa99ea02f","source":{"kind":"arxiv","id":"2407.02894","version":1},"attestation_state":"computed","paper":{"title":"Translatotron-V(ison): An End-to-End Model for In-Image Machine Translation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Fandong Meng, Jie Zhou, Jinsong Su, Liqiang Niu, Min Zhang, Zhibin Lan","submitted_at":"2024-07-03T08:15:39Z","abstract_excerpt":"In-image machine translation (IIMT) aims to translate an image containing texts in source language into an image containing translations in target language. In this regard, conventional cascaded methods suffer from issues such as error propagation, massive parameters, and difficulties in deployment and retaining visual characteristics of the input image. Thus, constructing end-to-end models has become an option, which, however, faces two main challenges: 1) the huge modeling burden, as it is required to simultaneously learn alignment across languages and preserve the visual characteristics of "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2407.02894","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2024-07-03T08:15:39Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"9244322337a883ac6a058f9b995de4e339e02eb1a22253dd577ee9fce2eb5087","abstract_canon_sha256":"e41c00359b95d28f1014405b5620404aa3c06d7b3a27512cb0d331239e726051"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:39:43.227329Z","signature_b64":"R1DB4CGTkcIPWkUeyaE1yGRbl6Zi2KvRNqXlR/gRvu0ORJw5R6Zrxc3RBP51EJcq/omOltoeBAZp3v4BgW0PDg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"c3260cc47ca486450ae285394667ce917f9bb7ad63eeedfeb2a28b0fa99ea02f","last_reissued_at":"2026-07-05T08:39:43.226898Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:39:43.226898Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Translatotron-V(ison): An End-to-End Model for In-Image Machine Translation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Fandong Meng, Jie Zhou, Jinsong Su, Liqiang Niu, Min Zhang, Zhibin Lan","submitted_at":"2024-07-03T08:15:39Z","abstract_excerpt":"In-image machine translation (IIMT) aims to translate an image containing texts in source language into an image containing translations in target language. In this regard, conventional cascaded methods suffer from issues such as error propagation, massive parameters, and difficulties in deployment and retaining visual characteristics of the input image. Thus, constructing end-to-end models has become an option, which, however, faces two main challenges: 1) the huge modeling burden, as it is required to simultaneously learn alignment across languages and preserve the visual characteristics of "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2407.02894","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2407.02894/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2407.02894","created_at":"2026-07-05T08:39:43.226955+00:00"},{"alias_kind":"arxiv_version","alias_value":"2407.02894v1","created_at":"2026-07-05T08:39:43.226955+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2407.02894","created_at":"2026-07-05T08:39:43.226955+00:00"},{"alias_kind":"pith_short_12","alias_value":"YMTAZRD4USDE","created_at":"2026-07-05T08:39:43.226955+00:00"},{"alias_kind":"pith_short_16","alias_value":"YMTAZRD4USDEKCXC","created_at":"2026-07-05T08:39:43.226955+00:00"},{"alias_kind":"pith_short_8","alias_value":"YMTAZRD4","created_at":"2026-07-05T08:39:43.226955+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.24333","citing_title":"UniTranslator: A Unified Multi-modal Framework for End-to-end In-Image Machine Translation","ref_index":17,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/YMTAZRD4USDEKCXCQU4UMZ6OSF","json":"https://pith.science/pith/YMTAZRD4USDEKCXCQU4UMZ6OSF.json","graph_json":"https://pith.science/api/pith-number/YMTAZRD4USDEKCXCQU4UMZ6OSF/graph.json","events_json":"https://pith.science/api/pith-number/YMTAZRD4USDEKCXCQU4UMZ6OSF/events.json","paper":"https://pith.science/paper/YMTAZRD4"},"agent_actions":{"view_html":"https://pith.science/pith/YMTAZRD4USDEKCXCQU4UMZ6OSF","download_json":"https://pith.science/pith/YMTAZRD4USDEKCXCQU4UMZ6OSF.json","view_paper":"https://pith.science/paper/YMTAZRD4","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2407.02894&json=true","fetch_graph":"https://pith.science/api/pith-number/YMTAZRD4USDEKCXCQU4UMZ6OSF/graph.json","fetch_events":"https://pith.science/api/pith-number/YMTAZRD4USDEKCXCQU4UMZ6OSF/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/YMTAZRD4USDEKCXCQU4UMZ6OSF/action/timestamp_anchor","attest_storage":"https://pith.science/pith/YMTAZRD4USDEKCXCQU4UMZ6OSF/action/storage_attestation","attest_author":"https://pith.science/pith/YMTAZRD4USDEKCXCQU4UMZ6OSF/action/author_attestation","sign_citation":"https://pith.science/pith/YMTAZRD4USDEKCXCQU4UMZ6OSF/action/citation_signature","submit_replication":"https://pith.science/pith/YMTAZRD4USDEKCXCQU4UMZ6OSF/action/replication_record"}},"created_at":"2026-07-05T08:39:43.226955+00:00","updated_at":"2026-07-05T08:39:43.226955+00:00"}