{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2022:7NFCALNNQGYGUIV4ZO4R25O7T6","short_pith_number":"pith:7NFCALNN","schema_version":"1.0","canonical_sha256":"fb4a202dad81b06a22bccbb91d75df9fa2b0b6aced661004ed42761414de2b47","source":{"kind":"arxiv","id":"2202.09509","version":1},"attestation_state":"computed","paper":{"title":"PETCI: A Parallel English Translation Dataset of Chinese Idioms","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CL","authors_text":"Kenan Tang (The University of Chicago)","submitted_at":"2022-02-19T03:16:20Z","abstract_excerpt":"Idioms are an important language phenomenon in Chinese, but idiom translation is notoriously hard. Current machine translation models perform poorly on idiom translation, while idioms are sparse in many translation datasets. We present PETCI, a parallel English translation dataset of Chinese idioms, aiming to improve idiom translation by both human and machine. The dataset is built by leveraging human and machine effort. Baseline generation models show unsatisfactory abilities to improve translation, but structure-aware classification models show good performance on distinguishing good transla"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2202.09509","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2022-02-19T03:16:20Z","cross_cats_sorted":["cs.LG"],"title_canon_sha256":"e377dad5813b54254abdf650dfd6a836399382c81b96569c13184be6d12beeff","abstract_canon_sha256":"b82668c1eb0217feb07d31caf17ab5236a8e028475dede0521a466fe6d41970e"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T03:58:23.236969Z","signature_b64":"QkgXOxaS2+3NMtDOy1MVvsxC7mmlAgjViTPCd8AEHvsqo/7hbKJZ3UMm/EqFN7pJ+YSLbPlNyzXEzzhQtAOFDA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"fb4a202dad81b06a22bccbb91d75df9fa2b0b6aced661004ed42761414de2b47","last_reissued_at":"2026-07-05T03:58:23.236500Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T03:58:23.236500Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"PETCI: A Parallel English Translation Dataset of Chinese Idioms","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CL","authors_text":"Kenan Tang (The University of Chicago)","submitted_at":"2022-02-19T03:16:20Z","abstract_excerpt":"Idioms are an important language phenomenon in Chinese, but idiom translation is notoriously hard. Current machine translation models perform poorly on idiom translation, while idioms are sparse in many translation datasets. We present PETCI, a parallel English translation dataset of Chinese idioms, aiming to improve idiom translation by both human and machine. The dataset is built by leveraging human and machine effort. Baseline generation models show unsatisfactory abilities to improve translation, but structure-aware classification models show good performance on distinguishing good transla"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2202.09509","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2202.09509/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2202.09509","created_at":"2026-07-05T03:58:23.236550+00:00"},{"alias_kind":"arxiv_version","alias_value":"2202.09509v1","created_at":"2026-07-05T03:58:23.236550+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2202.09509","created_at":"2026-07-05T03:58:23.236550+00:00"},{"alias_kind":"pith_short_12","alias_value":"7NFCALNNQGYG","created_at":"2026-07-05T03:58:23.236550+00:00"},{"alias_kind":"pith_short_16","alias_value":"7NFCALNNQGYGUIV4","created_at":"2026-07-05T03:58:23.236550+00:00"},{"alias_kind":"pith_short_8","alias_value":"7NFCALNN","created_at":"2026-07-05T03:58:23.236550+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2508.11828","citing_title":"A Survey of Idiom Datasets for Psycholinguistic and Computational Research","ref_index":2011,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/7NFCALNNQGYGUIV4ZO4R25O7T6","json":"https://pith.science/pith/7NFCALNNQGYGUIV4ZO4R25O7T6.json","graph_json":"https://pith.science/api/pith-number/7NFCALNNQGYGUIV4ZO4R25O7T6/graph.json","events_json":"https://pith.science/api/pith-number/7NFCALNNQGYGUIV4ZO4R25O7T6/events.json","paper":"https://pith.science/paper/7NFCALNN"},"agent_actions":{"view_html":"https://pith.science/pith/7NFCALNNQGYGUIV4ZO4R25O7T6","download_json":"https://pith.science/pith/7NFCALNNQGYGUIV4ZO4R25O7T6.json","view_paper":"https://pith.science/paper/7NFCALNN","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2202.09509&json=true","fetch_graph":"https://pith.science/api/pith-number/7NFCALNNQGYGUIV4ZO4R25O7T6/graph.json","fetch_events":"https://pith.science/api/pith-number/7NFCALNNQGYGUIV4ZO4R25O7T6/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/7NFCALNNQGYGUIV4ZO4R25O7T6/action/timestamp_anchor","attest_storage":"https://pith.science/pith/7NFCALNNQGYGUIV4ZO4R25O7T6/action/storage_attestation","attest_author":"https://pith.science/pith/7NFCALNNQGYGUIV4ZO4R25O7T6/action/author_attestation","sign_citation":"https://pith.science/pith/7NFCALNNQGYGUIV4ZO4R25O7T6/action/citation_signature","submit_replication":"https://pith.science/pith/7NFCALNNQGYGUIV4ZO4R25O7T6/action/replication_record"}},"created_at":"2026-07-05T03:58:23.236550+00:00","updated_at":"2026-07-05T03:58:23.236550+00:00"}