{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:Q4Q7YWEEVGTUFWY23FSQ2UFJT2","short_pith_number":"pith:Q4Q7YWEE","schema_version":"1.0","canonical_sha256":"8721fc5884a9a742db1ad9650d50a99e8f8606f80c6b9eb55d4fbf30cca53dac","source":{"kind":"arxiv","id":"2410.20672","version":3},"attestation_state":"computed","paper":{"title":"Relaxed Recursive Transformers: Effective Parameter Sharing with Layer-wise LoRA","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CL","authors_text":"Adam Fisch, Hrayr Harutyunyan, Sangmin Bae, Seungyeon Kim, Tal Schuster, Ziwei Ji","submitted_at":"2024-10-28T02:15:45Z","abstract_excerpt":"Large language models (LLMs) are expensive to deploy. Parameter sharing offers a possible path towards reducing their size and cost, but its effectiveness in modern LLMs remains fairly limited. In this work, we revisit \"layer tying\" as form of parameter sharing in Transformers, and introduce novel methods for converting existing LLMs into smaller \"Recursive Transformers\" that share parameters across layers, with minimal loss of performance. Here, our Recursive Transformers are efficiently initialized from standard pretrained Transformers, but only use a single block of unique layers that is th"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2410.20672","kind":"arxiv","version":3},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2024-10-28T02:15:45Z","cross_cats_sorted":["cs.LG"],"title_canon_sha256":"be7185e7f88969556684b0fad259257a9c669394ec73b073dc71a45664799fb5","abstract_canon_sha256":"e4fe637886c989c02751e252ad6a0501b2561006431df67429804bd4ae71ba0f"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:21:25.699359Z","signature_b64":"/PgeBAXDByMPRwvx83aHq7ZgmERuiTrvubkkv1vMTjBuQAlBfeNONgCqoyFcgvMeVU532sEFp4Zm2MeTSxdfCA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"8721fc5884a9a742db1ad9650d50a99e8f8606f80c6b9eb55d4fbf30cca53dac","last_reissued_at":"2026-07-05T10:21:25.698790Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:21:25.698790Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Relaxed Recursive Transformers: Effective Parameter Sharing with Layer-wise LoRA","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CL","authors_text":"Adam Fisch, Hrayr Harutyunyan, Sangmin Bae, Seungyeon Kim, Tal Schuster, Ziwei Ji","submitted_at":"2024-10-28T02:15:45Z","abstract_excerpt":"Large language models (LLMs) are expensive to deploy. Parameter sharing offers a possible path towards reducing their size and cost, but its effectiveness in modern LLMs remains fairly limited. In this work, we revisit \"layer tying\" as form of parameter sharing in Transformers, and introduce novel methods for converting existing LLMs into smaller \"Recursive Transformers\" that share parameters across layers, with minimal loss of performance. Here, our Recursive Transformers are efficiently initialized from standard pretrained Transformers, but only use a single block of unique layers that is th"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2410.20672","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2410.20672/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2410.20672","created_at":"2026-07-05T10:21:25.698850+00:00"},{"alias_kind":"arxiv_version","alias_value":"2410.20672v3","created_at":"2026-07-05T10:21:25.698850+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2410.20672","created_at":"2026-07-05T10:21:25.698850+00:00"},{"alias_kind":"pith_short_12","alias_value":"Q4Q7YWEEVGTU","created_at":"2026-07-05T10:21:25.698850+00:00"},{"alias_kind":"pith_short_16","alias_value":"Q4Q7YWEEVGTUFWY2","created_at":"2026-07-05T10:21:25.698850+00:00"},{"alias_kind":"pith_short_8","alias_value":"Q4Q7YWEE","created_at":"2026-07-05T10:21:25.698850+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":11,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.31215","citing_title":"Fixed-Point Masked Generative Modeling","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2605.19376","citing_title":"Generative Recursive Reasoning","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2605.19376","citing_title":"Generative Recursive Reasoning","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2510.03206","citing_title":"Coevolutionary Continuous Discrete Diffusion: Make Your Diffusion Language Model a Latent Reasoner","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2510.25741","citing_title":"Scaling Latent Reasoning via Looped Language Models","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2604.03428","citing_title":"Inference-Path Optimization via Circuit Duplication in Frozen Visual Transformers for Marine Species Classification","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2502.05171","citing_title":"Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06322","citing_title":"SMolLM: Small Language Models Learn Small Molecular Grammar","ref_index":54,"is_internal_anchor":false},{"citing_arxiv_id":"2604.21254","citing_title":"Hyperloop Transformers","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2604.12946","citing_title":"Parcae: Scaling Laws For Stable Looped Language Models","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2605.07588","citing_title":"Revisiting Transformer Layer Parameterization Through Causal Energy Minimization","ref_index":2,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/Q4Q7YWEEVGTUFWY23FSQ2UFJT2","json":"https://pith.science/pith/Q4Q7YWEEVGTUFWY23FSQ2UFJT2.json","graph_json":"https://pith.science/api/pith-number/Q4Q7YWEEVGTUFWY23FSQ2UFJT2/graph.json","events_json":"https://pith.science/api/pith-number/Q4Q7YWEEVGTUFWY23FSQ2UFJT2/events.json","paper":"https://pith.science/paper/Q4Q7YWEE"},"agent_actions":{"view_html":"https://pith.science/pith/Q4Q7YWEEVGTUFWY23FSQ2UFJT2","download_json":"https://pith.science/pith/Q4Q7YWEEVGTUFWY23FSQ2UFJT2.json","view_paper":"https://pith.science/paper/Q4Q7YWEE","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2410.20672&json=true","fetch_graph":"https://pith.science/api/pith-number/Q4Q7YWEEVGTUFWY23FSQ2UFJT2/graph.json","fetch_events":"https://pith.science/api/pith-number/Q4Q7YWEEVGTUFWY23FSQ2UFJT2/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/Q4Q7YWEEVGTUFWY23FSQ2UFJT2/action/timestamp_anchor","attest_storage":"https://pith.science/pith/Q4Q7YWEEVGTUFWY23FSQ2UFJT2/action/storage_attestation","attest_author":"https://pith.science/pith/Q4Q7YWEEVGTUFWY23FSQ2UFJT2/action/author_attestation","sign_citation":"https://pith.science/pith/Q4Q7YWEEVGTUFWY23FSQ2UFJT2/action/citation_signature","submit_replication":"https://pith.science/pith/Q4Q7YWEEVGTUFWY23FSQ2UFJT2/action/replication_record"}},"created_at":"2026-07-05T10:21:25.698850+00:00","updated_at":"2026-07-05T10:21:25.698850+00:00"}