{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:2LPXYQG7A6AP2P6SCWXSCHO5AV","short_pith_number":"pith:2LPXYQG7","schema_version":"1.0","canonical_sha256":"d2df7c40df0780fd3fd215af211ddd057a0b52a8aae179b19c82ff5d59c955f9","source":{"kind":"arxiv","id":"2406.08447","version":1},"attestation_state":"computed","paper":{"title":"The Impact of Initialization on LoRA Finetuning Dynamics","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.CL","stat.ML"],"primary_cat":"cs.LG","authors_text":"Bin Yu, Nikhil Ghosh, Soufiane Hayou","submitted_at":"2024-06-12T17:38:20Z","abstract_excerpt":"In this paper, we study the role of initialization in Low Rank Adaptation (LoRA) as originally introduced in Hu et al. (2021). Essentially, to start from the pretrained model as initialization for finetuning, one can either initialize B to zero and A to random (default initialization in PEFT package), or vice-versa. In both cases, the product BA is equal to zero at initialization, which makes finetuning starts from the pretrained model. These two initialization schemes are seemingly similar. They should in-principle yield the same performance and share the same optimal learning rate. We demons"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2406.08447","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2024-06-12T17:38:20Z","cross_cats_sorted":["cs.AI","cs.CL","stat.ML"],"title_canon_sha256":"291e1d1705ed3699d7d941fdf95103e4bfc78d000c1326417d3b171a71bb8184","abstract_canon_sha256":"d10b41cd80da59cb53c905c73ad84c1a8f5332bb4d604a2ed6e42f10ead003da"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:31:00.087408Z","signature_b64":"thcpx/mubzEhXB9JNhckBo/URR2iJfvnzvtjiQsVUqyznSVnVpeRPClceaVMatY6/n0ZCog9E5t3UQTJdUZECg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"d2df7c40df0780fd3fd215af211ddd057a0b52a8aae179b19c82ff5d59c955f9","last_reissued_at":"2026-07-05T08:31:00.086910Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:31:00.086910Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"The Impact of Initialization on LoRA Finetuning Dynamics","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.CL","stat.ML"],"primary_cat":"cs.LG","authors_text":"Bin Yu, Nikhil Ghosh, Soufiane Hayou","submitted_at":"2024-06-12T17:38:20Z","abstract_excerpt":"In this paper, we study the role of initialization in Low Rank Adaptation (LoRA) as originally introduced in Hu et al. (2021). Essentially, to start from the pretrained model as initialization for finetuning, one can either initialize B to zero and A to random (default initialization in PEFT package), or vice-versa. In both cases, the product BA is equal to zero at initialization, which makes finetuning starts from the pretrained model. These two initialization schemes are seemingly similar. They should in-principle yield the same performance and share the same optimal learning rate. We demons"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2406.08447","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2406.08447/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2406.08447","created_at":"2026-07-05T08:31:00.086978+00:00"},{"alias_kind":"arxiv_version","alias_value":"2406.08447v1","created_at":"2026-07-05T08:31:00.086978+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2406.08447","created_at":"2026-07-05T08:31:00.086978+00:00"},{"alias_kind":"pith_short_12","alias_value":"2LPXYQG7A6AP","created_at":"2026-07-05T08:31:00.086978+00:00"},{"alias_kind":"pith_short_16","alias_value":"2LPXYQG7A6AP2P6S","created_at":"2026-07-05T08:31:00.086978+00:00"},{"alias_kind":"pith_short_8","alias_value":"2LPXYQG7","created_at":"2026-07-05T08:31:00.086978+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":3,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.12883","citing_title":"The Hidden Power of Scaling Factor in LoRA Optimization","ref_index":41,"is_internal_anchor":false},{"citing_arxiv_id":"2606.31208","citing_title":"Probing Memorization of Tabular In-Context Learning","ref_index":81,"is_internal_anchor":false},{"citing_arxiv_id":"2509.18629","citing_title":"HyperAdapt: Simple High-Rank Adaptation","ref_index":13,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/2LPXYQG7A6AP2P6SCWXSCHO5AV","json":"https://pith.science/pith/2LPXYQG7A6AP2P6SCWXSCHO5AV.json","graph_json":"https://pith.science/api/pith-number/2LPXYQG7A6AP2P6SCWXSCHO5AV/graph.json","events_json":"https://pith.science/api/pith-number/2LPXYQG7A6AP2P6SCWXSCHO5AV/events.json","paper":"https://pith.science/paper/2LPXYQG7"},"agent_actions":{"view_html":"https://pith.science/pith/2LPXYQG7A6AP2P6SCWXSCHO5AV","download_json":"https://pith.science/pith/2LPXYQG7A6AP2P6SCWXSCHO5AV.json","view_paper":"https://pith.science/paper/2LPXYQG7","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2406.08447&json=true","fetch_graph":"https://pith.science/api/pith-number/2LPXYQG7A6AP2P6SCWXSCHO5AV/graph.json","fetch_events":"https://pith.science/api/pith-number/2LPXYQG7A6AP2P6SCWXSCHO5AV/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/2LPXYQG7A6AP2P6SCWXSCHO5AV/action/timestamp_anchor","attest_storage":"https://pith.science/pith/2LPXYQG7A6AP2P6SCWXSCHO5AV/action/storage_attestation","attest_author":"https://pith.science/pith/2LPXYQG7A6AP2P6SCWXSCHO5AV/action/author_attestation","sign_citation":"https://pith.science/pith/2LPXYQG7A6AP2P6SCWXSCHO5AV/action/citation_signature","submit_replication":"https://pith.science/pith/2LPXYQG7A6AP2P6SCWXSCHO5AV/action/replication_record"}},"created_at":"2026-07-05T08:31:00.086978+00:00","updated_at":"2026-07-05T08:31:00.086978+00:00"}