{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2019:M2MKVMQAQOB37RLQ23UF7ICNH3","short_pith_number":"pith:M2MKVMQA","schema_version":"1.0","canonical_sha256":"6698aab2008383bfc570d6e85fa04d3ec7b2e6369d65f42ce6d5027e8524b8b0","source":{"kind":"arxiv","id":"1909.11556","version":1},"attestation_state":"computed","paper":{"title":"Reducing Transformer Depth on Demand with Structured Dropout","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL","stat.ML"],"primary_cat":"cs.LG","authors_text":"Angela Fan, Armand Joulin, Edouard Grave","submitted_at":"2019-09-25T15:35:03Z","abstract_excerpt":"Overparameterized transformer networks have obtained state of the art results in various natural language processing tasks, such as machine translation, language modeling, and question answering. These models contain hundreds of millions of parameters, necessitating a large amount of computation and making them prone to overfitting. In this work, we explore LayerDrop, a form of structured dropout, which has a regularization effect during training and allows for efficient pruning at inference time. In particular, we show that it is possible to select sub-networks of any depth from one large net"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"1909.11556","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2019-09-25T15:35:03Z","cross_cats_sorted":["cs.CL","stat.ML"],"title_canon_sha256":"b7b0e754d5c0d7362b966a459fa8027f78f934507e03d2a8bca4455ea47601bd","abstract_canon_sha256":"8f2b3929b1c7361c22406d7e1a6fe9699b44d29d2309617034a90e70a5ff373e"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T00:07:18.497007Z","signature_b64":"qeGzvNMKEdobCk1vDqxllTz58s95qVPPxYY+RmqoJ5nXSPGo9ggsTVN3V4bPcVWiG6Ebi6wmveAQmwtrjWdAAQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"6698aab2008383bfc570d6e85fa04d3ec7b2e6369d65f42ce6d5027e8524b8b0","last_reissued_at":"2026-07-05T00:07:18.496629Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T00:07:18.496629Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Reducing Transformer Depth on Demand with Structured Dropout","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL","stat.ML"],"primary_cat":"cs.LG","authors_text":"Angela Fan, Armand Joulin, Edouard Grave","submitted_at":"2019-09-25T15:35:03Z","abstract_excerpt":"Overparameterized transformer networks have obtained state of the art results in various natural language processing tasks, such as machine translation, language modeling, and question answering. These models contain hundreds of millions of parameters, necessitating a large amount of computation and making them prone to overfitting. In this work, we explore LayerDrop, a form of structured dropout, which has a regularization effect during training and allows for efficient pruning at inference time. In particular, we show that it is possible to select sub-networks of any depth from one large net"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"1909.11556","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/1909.11556/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"1909.11556","created_at":"2026-07-05T00:07:18.496683+00:00"},{"alias_kind":"arxiv_version","alias_value":"1909.11556v1","created_at":"2026-07-05T00:07:18.496683+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.1909.11556","created_at":"2026-07-05T00:07:18.496683+00:00"},{"alias_kind":"pith_short_12","alias_value":"M2MKVMQAQOB3","created_at":"2026-07-05T00:07:18.496683+00:00"},{"alias_kind":"pith_short_16","alias_value":"M2MKVMQAQOB37RLQ","created_at":"2026-07-05T00:07:18.496683+00:00"},{"alias_kind":"pith_short_8","alias_value":"M2MKVMQA","created_at":"2026-07-05T00:07:18.496683+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":18,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.23670","citing_title":"Tapered Language Models","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2606.06574","citing_title":"Skip a Layer or Loop It? Learning Program-of-Layers in LLMs","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2606.29983","citing_title":"Stabilizing Extrapolation in Looped Transformers via Learned Stochastic Stopping","ref_index":34,"is_internal_anchor":false},{"citing_arxiv_id":"2606.09131","citing_title":"Late-Layer Fusion is Enough: Dual-Path Vision Token Routing for Multimodal Large Language Models under Visual Saturation","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2508.04427","citing_title":"Decoding the Multimodal Maze: A Systematic Review on the Adoption of Explainability in Multimodal Attention-based Models","ref_index":105,"is_internal_anchor":false},{"citing_arxiv_id":"2508.03949","citing_title":"Model Compression vs. Adversarial Robustness: An Empirical Study on Language Models for Code","ref_index":72,"is_internal_anchor":false},{"citing_arxiv_id":"2006.15704","citing_title":"PyTorch Distributed: Experiences on Accelerating Data Parallel Training","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14037","citing_title":"Self-Pruned Key-Value Attention: Learning When to Write by Predicting Future Utility","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12714","citing_title":"Layer-wise Representation Dynamics: An Empirical Investigation Across Embedders and Base LLMs","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2604.22782","citing_title":"Stochastic KV Routing: Enabling Adaptive Depth-Wise Cache Sharing","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2604.15351","citing_title":"Aletheia: Gradient-Guided Layer Selection for Efficient LoRA Fine-Tuning Across Architectures","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2303.08112","citing_title":"Eliciting Latent Predictions from Transformers with the Tuned Lens","ref_index":33,"is_internal_anchor":false},{"citing_arxiv_id":"2502.05171","citing_title":"Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach","ref_index":52,"is_internal_anchor":false},{"citing_arxiv_id":"2604.26181","citing_title":"SWAN: World-Aware Adaptive Multimodal Networks for Runtime Variations","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2604.24380","citing_title":"Structural Pruning of Large Vision Language Models: A Comprehensive Study on Pruning Dynamics, Recovery, and Data Efficiency","ref_index":51,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06105","citing_title":"Shallow Prefill, Deep Decoding: Efficient Long-Context Inference via Layer-Asymmetric KV Visibility","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2604.17286","citing_title":"Depth Adaptive Efficient Visual Autoregressive Modeling","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2604.17465","citing_title":"Language models recognize dropout and Gaussian noise applied to their activations","ref_index":4,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/M2MKVMQAQOB37RLQ23UF7ICNH3","json":"https://pith.science/pith/M2MKVMQAQOB37RLQ23UF7ICNH3.json","graph_json":"https://pith.science/api/pith-number/M2MKVMQAQOB37RLQ23UF7ICNH3/graph.json","events_json":"https://pith.science/api/pith-number/M2MKVMQAQOB37RLQ23UF7ICNH3/events.json","paper":"https://pith.science/paper/M2MKVMQA"},"agent_actions":{"view_html":"https://pith.science/pith/M2MKVMQAQOB37RLQ23UF7ICNH3","download_json":"https://pith.science/pith/M2MKVMQAQOB37RLQ23UF7ICNH3.json","view_paper":"https://pith.science/paper/M2MKVMQA","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=1909.11556&json=true","fetch_graph":"https://pith.science/api/pith-number/M2MKVMQAQOB37RLQ23UF7ICNH3/graph.json","fetch_events":"https://pith.science/api/pith-number/M2MKVMQAQOB37RLQ23UF7ICNH3/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/M2MKVMQAQOB37RLQ23UF7ICNH3/action/timestamp_anchor","attest_storage":"https://pith.science/pith/M2MKVMQAQOB37RLQ23UF7ICNH3/action/storage_attestation","attest_author":"https://pith.science/pith/M2MKVMQAQOB37RLQ23UF7ICNH3/action/author_attestation","sign_citation":"https://pith.science/pith/M2MKVMQAQOB37RLQ23UF7ICNH3/action/citation_signature","submit_replication":"https://pith.science/pith/M2MKVMQAQOB37RLQ23UF7ICNH3/action/replication_record"}},"created_at":"2026-07-05T00:07:18.496683+00:00","updated_at":"2026-07-05T00:07:18.496683+00:00"}