{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2020:KSIZGZADEWS4O7FQTXD77UPTFJ","short_pith_number":"pith:KSIZGZAD","schema_version":"1.0","canonical_sha256":"549193640325a5c77cb09dc7ffd1f32a5c77e76c2e566de642f83e0e63f0711b","source":{"kind":"arxiv","id":"2012.07463","version":2},"attestation_state":"computed","paper":{"title":"Parameter-Efficient Transfer Learning with Diff Pruning","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CL","authors_text":"Alexander M. Rush, Demi Guo, Yoon Kim","submitted_at":"2020-12-14T12:34:01Z","abstract_excerpt":"While task-specific finetuning of pretrained networks has led to significant empirical advances in NLP, the large size of networks makes finetuning difficult to deploy in multi-task, memory-constrained settings. We propose diff pruning as a simple approach to enable parameter-efficient transfer learning within the pretrain-finetune framework. This approach views finetuning as learning a task-specific diff vector that is applied on top of the pretrained parameter vector, which remains fixed and is shared across different tasks. The diff vector is adaptively pruned during training with a differe"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2012.07463","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2020-12-14T12:34:01Z","cross_cats_sorted":["cs.LG"],"title_canon_sha256":"5a1222f18d310011e4dcadada8734f75e499ee61a20128bd466d6616db60de2d","abstract_canon_sha256":"cf35095ef9e75a55fcf4a32325c87cc7cf268a0a3f6d3f0f391080977027ecbb"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T02:47:40.971777Z","signature_b64":"gkS8ApnRwSvdj/DUHP0g0Sd/PVPhfu0oGuBVh8P+OFuProTxiJFI/xvSMG2Nsgc9RLauc/pBMKUmm4JrvLqlAg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"549193640325a5c77cb09dc7ffd1f32a5c77e76c2e566de642f83e0e63f0711b","last_reissued_at":"2026-07-05T02:47:40.971415Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T02:47:40.971415Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Parameter-Efficient Transfer Learning with Diff Pruning","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CL","authors_text":"Alexander M. Rush, Demi Guo, Yoon Kim","submitted_at":"2020-12-14T12:34:01Z","abstract_excerpt":"While task-specific finetuning of pretrained networks has led to significant empirical advances in NLP, the large size of networks makes finetuning difficult to deploy in multi-task, memory-constrained settings. We propose diff pruning as a simple approach to enable parameter-efficient transfer learning within the pretrain-finetune framework. This approach views finetuning as learning a task-specific diff vector that is applied on top of the pretrained parameter vector, which remains fixed and is shared across different tasks. The diff vector is adaptively pruned during training with a differe"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2012.07463","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2012.07463/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2012.07463","created_at":"2026-07-05T02:47:40.971478+00:00"},{"alias_kind":"arxiv_version","alias_value":"2012.07463v2","created_at":"2026-07-05T02:47:40.971478+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2012.07463","created_at":"2026-07-05T02:47:40.971478+00:00"},{"alias_kind":"pith_short_12","alias_value":"KSIZGZADEWS4","created_at":"2026-07-05T02:47:40.971478+00:00"},{"alias_kind":"pith_short_16","alias_value":"KSIZGZADEWS4O7FQ","created_at":"2026-07-05T02:47:40.971478+00:00"},{"alias_kind":"pith_short_8","alias_value":"KSIZGZAD","created_at":"2026-07-05T02:47:40.971478+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":4,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2512.19219","citing_title":"Selective LoRA for Visual Tokens and Attention Heads","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2403.14608","citing_title":"Parameter-Efficient Fine-Tuning for Large Models: A Comprehensive Survey","ref_index":63,"is_internal_anchor":false},{"citing_arxiv_id":"2604.09088","citing_title":"Memory-Efficient Transfer Learning with Fading Side Networks via Masked Dual Path Distillation","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2605.04058","citing_title":"MP-ISMoE: Mixed-Precision Interactive Side Mixture-of-Experts for Efficient Transfer Learning","ref_index":52,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/KSIZGZADEWS4O7FQTXD77UPTFJ","json":"https://pith.science/pith/KSIZGZADEWS4O7FQTXD77UPTFJ.json","graph_json":"https://pith.science/api/pith-number/KSIZGZADEWS4O7FQTXD77UPTFJ/graph.json","events_json":"https://pith.science/api/pith-number/KSIZGZADEWS4O7FQTXD77UPTFJ/events.json","paper":"https://pith.science/paper/KSIZGZAD"},"agent_actions":{"view_html":"https://pith.science/pith/KSIZGZADEWS4O7FQTXD77UPTFJ","download_json":"https://pith.science/pith/KSIZGZADEWS4O7FQTXD77UPTFJ.json","view_paper":"https://pith.science/paper/KSIZGZAD","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2012.07463&json=true","fetch_graph":"https://pith.science/api/pith-number/KSIZGZADEWS4O7FQTXD77UPTFJ/graph.json","fetch_events":"https://pith.science/api/pith-number/KSIZGZADEWS4O7FQTXD77UPTFJ/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/KSIZGZADEWS4O7FQTXD77UPTFJ/action/timestamp_anchor","attest_storage":"https://pith.science/pith/KSIZGZADEWS4O7FQTXD77UPTFJ/action/storage_attestation","attest_author":"https://pith.science/pith/KSIZGZADEWS4O7FQTXD77UPTFJ/action/author_attestation","sign_citation":"https://pith.science/pith/KSIZGZADEWS4O7FQTXD77UPTFJ/action/citation_signature","submit_replication":"https://pith.science/pith/KSIZGZADEWS4O7FQTXD77UPTFJ/action/replication_record"}},"created_at":"2026-07-05T02:47:40.971478+00:00","updated_at":"2026-07-05T02:47:40.971478+00:00"}