{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:MGKTOKFWW6T2BHIUFXKGDOI65E","short_pith_number":"pith:MGKTOKFW","schema_version":"1.0","canonical_sha256":"61953728b6b7a7a09d142dd461b91ee9071bda788ed2007cd4719227eba63b58","source":{"kind":"arxiv","id":"2501.09767","version":1},"attestation_state":"computed","paper":{"title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Ju Ren, Kun Li, Ting Cao, Tuowei Wang, Xingyu Chen, Yaoxue Zhang","submitted_at":"2025-01-15T05:17:12Z","abstract_excerpt":"The escalating demand for long-context applications has intensified the necessity of extending the LLM context windows. Despite recent fine-tuning approaches successfully expanding context lengths, their high memory footprints, especially for activations, present a critical practical limitation. Current parameter-efficient fine-tuning methods prioritize reducing parameter update overhead over addressing activation memory constraints. Similarly, existing sparsity mechanisms improve computational efficiency but overlook activation memory optimization due to the phenomenon of Shadowy Activation.\n"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2501.09767","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2025-01-15T05:17:12Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"db14e5c6a1e7a4744ae7e6f5e09868a5704c50b1288b70a44dfedfcedac404bb","abstract_canon_sha256":"c248e14e94ed42f0e41dd792863310c864a32d864286c8669b1daadd911bcc79"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:02:10.803726Z","signature_b64":"pfFTnHQvAt+RG/impW6Fn3Lk1xvyCpA3FB9FDK9pnFk6QyxL2Nr4JNy72YJA8hGDBPAWtpW2vHK7GZAouEJ5DQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"61953728b6b7a7a09d142dd461b91ee9071bda788ed2007cd4719227eba63b58","last_reissued_at":"2026-07-05T10:02:10.803158Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:02:10.803158Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Ju Ren, Kun Li, Ting Cao, Tuowei Wang, Xingyu Chen, Yaoxue Zhang","submitted_at":"2025-01-15T05:17:12Z","abstract_excerpt":"The escalating demand for long-context applications has intensified the necessity of extending the LLM context windows. Despite recent fine-tuning approaches successfully expanding context lengths, their high memory footprints, especially for activations, present a critical practical limitation. Current parameter-efficient fine-tuning methods prioritize reducing parameter update overhead over addressing activation memory constraints. Similarly, existing sparsity mechanisms improve computational efficiency but overlook activation memory optimization due to the phenomenon of Shadowy Activation.\n"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2501.09767","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2501.09767/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2501.09767","created_at":"2026-07-05T10:02:10.803233+00:00"},{"alias_kind":"arxiv_version","alias_value":"2501.09767v1","created_at":"2026-07-05T10:02:10.803233+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2501.09767","created_at":"2026-07-05T10:02:10.803233+00:00"},{"alias_kind":"pith_short_12","alias_value":"MGKTOKFWW6T2","created_at":"2026-07-05T10:02:10.803233+00:00"},{"alias_kind":"pith_short_16","alias_value":"MGKTOKFWW6T2BHIU","created_at":"2026-07-05T10:02:10.803233+00:00"},{"alias_kind":"pith_short_8","alias_value":"MGKTOKFW","created_at":"2026-07-05T10:02:10.803233+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":2,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.08476","citing_title":"FlashCP: Load-Balanced Communication-Efficient Context Parallelism for LLM Training","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2604.10060","citing_title":"Mosaic: Cross-Modal Clustering for Efficient Video Understanding","ref_index":41,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/MGKTOKFWW6T2BHIUFXKGDOI65E","json":"https://pith.science/pith/MGKTOKFWW6T2BHIUFXKGDOI65E.json","graph_json":"https://pith.science/api/pith-number/MGKTOKFWW6T2BHIUFXKGDOI65E/graph.json","events_json":"https://pith.science/api/pith-number/MGKTOKFWW6T2BHIUFXKGDOI65E/events.json","paper":"https://pith.science/paper/MGKTOKFW"},"agent_actions":{"view_html":"https://pith.science/pith/MGKTOKFWW6T2BHIUFXKGDOI65E","download_json":"https://pith.science/pith/MGKTOKFWW6T2BHIUFXKGDOI65E.json","view_paper":"https://pith.science/paper/MGKTOKFW","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2501.09767&json=true","fetch_graph":"https://pith.science/api/pith-number/MGKTOKFWW6T2BHIUFXKGDOI65E/graph.json","fetch_events":"https://pith.science/api/pith-number/MGKTOKFWW6T2BHIUFXKGDOI65E/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/MGKTOKFWW6T2BHIUFXKGDOI65E/action/timestamp_anchor","attest_storage":"https://pith.science/pith/MGKTOKFWW6T2BHIUFXKGDOI65E/action/storage_attestation","attest_author":"https://pith.science/pith/MGKTOKFWW6T2BHIUFXKGDOI65E/action/author_attestation","sign_citation":"https://pith.science/pith/MGKTOKFWW6T2BHIUFXKGDOI65E/action/citation_signature","submit_replication":"https://pith.science/pith/MGKTOKFWW6T2BHIUFXKGDOI65E/action/replication_record"}},"created_at":"2026-07-05T10:02:10.803233+00:00","updated_at":"2026-07-05T10:02:10.803233+00:00"}