{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:5BB62S33X2TPPHU4EK37DDT3JT","short_pith_number":"pith:5BB62S33","schema_version":"1.0","canonical_sha256":"e843ed4b7bbea6f79e9c22b7f18e7b4cf4afb5dc0d6c5b5e4541dff648f8d972","source":{"kind":"arxiv","id":"2311.06243","version":2},"attestation_state":"computed","paper":{"title":"Parameter-Efficient Orthogonal Finetuning via Butterfly Factorization","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CL","cs.CV"],"primary_cat":"cs.LG","authors_text":"Adrian Weller, Bernhard Sch\\\"olkopf, Haiwen Feng, Juyeon Heo, Longhui Yu, Michael J. Black, Songyou Peng, Weiyang Liu, Yandong Wen, Yao Feng, Yuliang Xiu, Yuxuan Xue, Zeju Qiu, Zhen Liu","submitted_at":"2023-11-10T18:59:54Z","abstract_excerpt":"Large foundation models are becoming ubiquitous, but training them from scratch is prohibitively expensive. Thus, efficiently adapting these powerful models to downstream tasks is increasingly important. In this paper, we study a principled finetuning paradigm -- Orthogonal Finetuning (OFT) -- for downstream task adaptation. Despite demonstrating good generalizability, OFT still uses a fairly large number of trainable parameters due to the high dimensionality of orthogonal matrices. To address this, we start by examining OFT from an information transmission perspective, and then identify a few"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2311.06243","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2023-11-10T18:59:54Z","cross_cats_sorted":["cs.AI","cs.CL","cs.CV"],"title_canon_sha256":"28c321a11273cef619289f03267b4f9712cb544621f9075dd4a06aa0f4dab48e","abstract_canon_sha256":"1c360341cda0eb4d2270b6c70afb3d95ac64503ecbd5dec86d021666ffe7b811"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:12:46.042790Z","signature_b64":"o8adv9PYKSDqg5oAwxRoIvLIyZm8DAtdrvP2BgSb1SsRzRG8kEXd5t2NFlf3DwVAd/BNhaXicvrnbbvzXRAVBA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"e843ed4b7bbea6f79e9c22b7f18e7b4cf4afb5dc0d6c5b5e4541dff648f8d972","last_reissued_at":"2026-07-05T08:12:46.042362Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:12:46.042362Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Parameter-Efficient Orthogonal Finetuning via Butterfly Factorization","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CL","cs.CV"],"primary_cat":"cs.LG","authors_text":"Adrian Weller, Bernhard Sch\\\"olkopf, Haiwen Feng, Juyeon Heo, Longhui Yu, Michael J. Black, Songyou Peng, Weiyang Liu, Yandong Wen, Yao Feng, Yuliang Xiu, Yuxuan Xue, Zeju Qiu, Zhen Liu","submitted_at":"2023-11-10T18:59:54Z","abstract_excerpt":"Large foundation models are becoming ubiquitous, but training them from scratch is prohibitively expensive. Thus, efficiently adapting these powerful models to downstream tasks is increasingly important. In this paper, we study a principled finetuning paradigm -- Orthogonal Finetuning (OFT) -- for downstream task adaptation. Despite demonstrating good generalizability, OFT still uses a fairly large number of trainable parameters due to the high dimensionality of orthogonal matrices. To address this, we start by examining OFT from an information transmission perspective, and then identify a few"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2311.06243","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2311.06243/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2311.06243","created_at":"2026-07-05T08:12:46.042420+00:00"},{"alias_kind":"arxiv_version","alias_value":"2311.06243v2","created_at":"2026-07-05T08:12:46.042420+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2311.06243","created_at":"2026-07-05T08:12:46.042420+00:00"},{"alias_kind":"pith_short_12","alias_value":"5BB62S33X2TP","created_at":"2026-07-05T08:12:46.042420+00:00"},{"alias_kind":"pith_short_16","alias_value":"5BB62S33X2TPPHU4","created_at":"2026-07-05T08:12:46.042420+00:00"},{"alias_kind":"pith_short_8","alias_value":"5BB62S33","created_at":"2026-07-05T08:12:46.042420+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":3,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.22383","citing_title":"Structured Hyperedge Adaptation for Parameter-Efficient Fine-Tuning of Vision Transformers","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2402.09353","citing_title":"DoRA: Weight-Decomposed Low-Rank Adaptation","ref_index":87,"is_internal_anchor":false},{"citing_arxiv_id":"2604.21905","citing_title":"Low-Rank Adaptation Redux for Large Models","ref_index":117,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/5BB62S33X2TPPHU4EK37DDT3JT","json":"https://pith.science/pith/5BB62S33X2TPPHU4EK37DDT3JT.json","graph_json":"https://pith.science/api/pith-number/5BB62S33X2TPPHU4EK37DDT3JT/graph.json","events_json":"https://pith.science/api/pith-number/5BB62S33X2TPPHU4EK37DDT3JT/events.json","paper":"https://pith.science/paper/5BB62S33"},"agent_actions":{"view_html":"https://pith.science/pith/5BB62S33X2TPPHU4EK37DDT3JT","download_json":"https://pith.science/pith/5BB62S33X2TPPHU4EK37DDT3JT.json","view_paper":"https://pith.science/paper/5BB62S33","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2311.06243&json=true","fetch_graph":"https://pith.science/api/pith-number/5BB62S33X2TPPHU4EK37DDT3JT/graph.json","fetch_events":"https://pith.science/api/pith-number/5BB62S33X2TPPHU4EK37DDT3JT/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/5BB62S33X2TPPHU4EK37DDT3JT/action/timestamp_anchor","attest_storage":"https://pith.science/pith/5BB62S33X2TPPHU4EK37DDT3JT/action/storage_attestation","attest_author":"https://pith.science/pith/5BB62S33X2TPPHU4EK37DDT3JT/action/author_attestation","sign_citation":"https://pith.science/pith/5BB62S33X2TPPHU4EK37DDT3JT/action/citation_signature","submit_replication":"https://pith.science/pith/5BB62S33X2TPPHU4EK37DDT3JT/action/replication_record"}},"created_at":"2026-07-05T08:12:46.042420+00:00","updated_at":"2026-07-05T08:12:46.042420+00:00"}