{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:G6YXPYXEQDB3CJ52G7IQKHCTGI","short_pith_number":"pith:G6YXPYXE","schema_version":"1.0","canonical_sha256":"37b177e2e480c3b127ba37d1051c533206e7b4cdfcab9e472078035a331915a8","source":{"kind":"arxiv","id":"2402.16361","version":1},"attestation_state":"computed","paper":{"title":"Layer-wise Regularized Dropout for Neural Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Chengming Li, Min Yang, Ruifeng Xu, Shiwen Ni, Xiping Hu","submitted_at":"2024-02-26T07:31:35Z","abstract_excerpt":"Among the various pre-trained neural language models that are popular today, dropout is already an indispensable regularization technique. To solve the inconsistency between training and inference caused by the randomness of dropout, some studies use consistency training to regularize dropout at the output layer. In this paper, we propose a novel Layer-wise Regularized Dropout (LR-Drop), which is specially designed for Transformer-based Language models. Specifically, LR-Drop layer-wise regularizes each Transformer layer using the consistency training strategy. Each training sample passes throu"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2402.16361","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2024-02-26T07:31:35Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"1b025280ef31ca174c55400f03fff6b240de81e374b9b4f433b506a66c78b6f9","abstract_canon_sha256":"aa774228bebf5bcea67e75d60eb77493fd7901629b5ab4812b4b8f2abcfdf216"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T07:49:20.669548Z","signature_b64":"sNZ1ceTaOfGFXMlqLMFNecz05Pxy6cQY94emuUUF9bwJlCivoOZRBQIc079iT2tQhBnxkokHLKGi+O2RqNf9Bg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"37b177e2e480c3b127ba37d1051c533206e7b4cdfcab9e472078035a331915a8","last_reissued_at":"2026-07-05T07:49:20.669125Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T07:49:20.669125Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Layer-wise Regularized Dropout for Neural Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Chengming Li, Min Yang, Ruifeng Xu, Shiwen Ni, Xiping Hu","submitted_at":"2024-02-26T07:31:35Z","abstract_excerpt":"Among the various pre-trained neural language models that are popular today, dropout is already an indispensable regularization technique. To solve the inconsistency between training and inference caused by the randomness of dropout, some studies use consistency training to regularize dropout at the output layer. In this paper, we propose a novel Layer-wise Regularized Dropout (LR-Drop), which is specially designed for Transformer-based Language models. Specifically, LR-Drop layer-wise regularizes each Transformer layer using the consistency training strategy. Each training sample passes throu"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2402.16361","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2402.16361/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2402.16361","created_at":"2026-07-05T07:49:20.669181+00:00"},{"alias_kind":"arxiv_version","alias_value":"2402.16361v1","created_at":"2026-07-05T07:49:20.669181+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2402.16361","created_at":"2026-07-05T07:49:20.669181+00:00"},{"alias_kind":"pith_short_12","alias_value":"G6YXPYXEQDB3","created_at":"2026-07-05T07:49:20.669181+00:00"},{"alias_kind":"pith_short_16","alias_value":"G6YXPYXEQDB3CJ52","created_at":"2026-07-05T07:49:20.669181+00:00"},{"alias_kind":"pith_short_8","alias_value":"G6YXPYXE","created_at":"2026-07-05T07:49:20.669181+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/G6YXPYXEQDB3CJ52G7IQKHCTGI","json":"https://pith.science/pith/G6YXPYXEQDB3CJ52G7IQKHCTGI.json","graph_json":"https://pith.science/api/pith-number/G6YXPYXEQDB3CJ52G7IQKHCTGI/graph.json","events_json":"https://pith.science/api/pith-number/G6YXPYXEQDB3CJ52G7IQKHCTGI/events.json","paper":"https://pith.science/paper/G6YXPYXE"},"agent_actions":{"view_html":"https://pith.science/pith/G6YXPYXEQDB3CJ52G7IQKHCTGI","download_json":"https://pith.science/pith/G6YXPYXEQDB3CJ52G7IQKHCTGI.json","view_paper":"https://pith.science/paper/G6YXPYXE","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2402.16361&json=true","fetch_graph":"https://pith.science/api/pith-number/G6YXPYXEQDB3CJ52G7IQKHCTGI/graph.json","fetch_events":"https://pith.science/api/pith-number/G6YXPYXEQDB3CJ52G7IQKHCTGI/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/G6YXPYXEQDB3CJ52G7IQKHCTGI/action/timestamp_anchor","attest_storage":"https://pith.science/pith/G6YXPYXEQDB3CJ52G7IQKHCTGI/action/storage_attestation","attest_author":"https://pith.science/pith/G6YXPYXEQDB3CJ52G7IQKHCTGI/action/author_attestation","sign_citation":"https://pith.science/pith/G6YXPYXEQDB3CJ52G7IQKHCTGI/action/citation_signature","submit_replication":"https://pith.science/pith/G6YXPYXEQDB3CJ52G7IQKHCTGI/action/replication_record"}},"created_at":"2026-07-05T07:49:20.669181+00:00","updated_at":"2026-07-05T07:49:20.669181+00:00"}