{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:74GR6D5V5LUM6DRPXCZ7NQG5Y6","short_pith_number":"pith:74GR6D5V","schema_version":"1.0","canonical_sha256":"ff0d1f0fb5eae8cf0e2fb8b3f6c0ddc78de5646fbe0bf228f2e058f28c7babdf","source":{"kind":"arxiv","id":"2404.11932","version":3},"attestation_state":"computed","paper":{"title":"CrossIn: An Efficient Instruction Tuning Approach for Cross-Lingual Knowledge Alignment","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Bin Wang, Geyu Lin, Nancy F. Chen, Zhengyuan Liu","submitted_at":"2024-04-18T06:20:50Z","abstract_excerpt":"Multilingual proficiency presents a significant challenge for large language models (LLMs). English-centric models are usually suboptimal in other languages, particularly those that are linguistically distant from English. This performance discrepancy mainly stems from the imbalanced distribution of training data across languages during pre-training and instruction tuning stages. To address this problem, we propose a novel approach called CrossIn, which utilizes a mixed composition of cross-lingual instruction tuning data. Our method leverages the compressed representation shared by various la"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2404.11932","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2024-04-18T06:20:50Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"5235a8a1032c7958c64e4991d02708e44f36ab9c5f33d7b8606459b7c446b234","abstract_canon_sha256":"33f2f8b6ec5559f1da8a7eb5ccdaab7eacca1d5c3d767c6db18cfcece7af2d66"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:56:51.111745Z","signature_b64":"UKjd7/Vjo5n2GR9EOqp6BgTzAFl2kxzYvlQh7688Xu+hNn49l3CWK6tZZExOB2CY7KaPyeGAJvc9lkXgZOSoDA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"ff0d1f0fb5eae8cf0e2fb8b3f6c0ddc78de5646fbe0bf228f2e058f28c7babdf","last_reissued_at":"2026-07-05T09:56:51.111269Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:56:51.111269Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"CrossIn: An Efficient Instruction Tuning Approach for Cross-Lingual Knowledge Alignment","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Bin Wang, Geyu Lin, Nancy F. Chen, Zhengyuan Liu","submitted_at":"2024-04-18T06:20:50Z","abstract_excerpt":"Multilingual proficiency presents a significant challenge for large language models (LLMs). English-centric models are usually suboptimal in other languages, particularly those that are linguistically distant from English. This performance discrepancy mainly stems from the imbalanced distribution of training data across languages during pre-training and instruction tuning stages. To address this problem, we propose a novel approach called CrossIn, which utilizes a mixed composition of cross-lingual instruction tuning data. Our method leverages the compressed representation shared by various la"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2404.11932","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2404.11932/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2404.11932","created_at":"2026-07-05T09:56:51.111336+00:00"},{"alias_kind":"arxiv_version","alias_value":"2404.11932v3","created_at":"2026-07-05T09:56:51.111336+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2404.11932","created_at":"2026-07-05T09:56:51.111336+00:00"},{"alias_kind":"pith_short_12","alias_value":"74GR6D5V5LUM","created_at":"2026-07-05T09:56:51.111336+00:00"},{"alias_kind":"pith_short_16","alias_value":"74GR6D5V5LUM6DRP","created_at":"2026-07-05T09:56:51.111336+00:00"},{"alias_kind":"pith_short_8","alias_value":"74GR6D5V","created_at":"2026-07-05T09:56:51.111336+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2507.14239","citing_title":"CCL-XCoT: An Efficient Cross-Lingual Knowledge Transfer Method for Mitigating Hallucination Generation","ref_index":22,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/74GR6D5V5LUM6DRPXCZ7NQG5Y6","json":"https://pith.science/pith/74GR6D5V5LUM6DRPXCZ7NQG5Y6.json","graph_json":"https://pith.science/api/pith-number/74GR6D5V5LUM6DRPXCZ7NQG5Y6/graph.json","events_json":"https://pith.science/api/pith-number/74GR6D5V5LUM6DRPXCZ7NQG5Y6/events.json","paper":"https://pith.science/paper/74GR6D5V"},"agent_actions":{"view_html":"https://pith.science/pith/74GR6D5V5LUM6DRPXCZ7NQG5Y6","download_json":"https://pith.science/pith/74GR6D5V5LUM6DRPXCZ7NQG5Y6.json","view_paper":"https://pith.science/paper/74GR6D5V","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2404.11932&json=true","fetch_graph":"https://pith.science/api/pith-number/74GR6D5V5LUM6DRPXCZ7NQG5Y6/graph.json","fetch_events":"https://pith.science/api/pith-number/74GR6D5V5LUM6DRPXCZ7NQG5Y6/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/74GR6D5V5LUM6DRPXCZ7NQG5Y6/action/timestamp_anchor","attest_storage":"https://pith.science/pith/74GR6D5V5LUM6DRPXCZ7NQG5Y6/action/storage_attestation","attest_author":"https://pith.science/pith/74GR6D5V5LUM6DRPXCZ7NQG5Y6/action/author_attestation","sign_citation":"https://pith.science/pith/74GR6D5V5LUM6DRPXCZ7NQG5Y6/action/citation_signature","submit_replication":"https://pith.science/pith/74GR6D5V5LUM6DRPXCZ7NQG5Y6/action/replication_record"}},"created_at":"2026-07-05T09:56:51.111336+00:00","updated_at":"2026-07-05T09:56:51.111336+00:00"}