{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:CB6DAHZXGCK7SX27N46X4JIWQX","short_pith_number":"pith:CB6DAHZX","schema_version":"1.0","canonical_sha256":"107c301f373095f95f5f6f3d7e251685c2437c74162d375be22d751f8f38e63d","source":{"kind":"arxiv","id":"2307.14995","version":2},"attestation_state":"computed","paper":{"title":"TransNormerLLM: A Faster and Better Large Language Model with Improved TransNormer","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Baohong Lv, Dong Li, Weigao Sun, Weixuan Sun, Xiaodong Han, Xiao Luo, Xuyang Shen, Yiran Zhong, Yunshen Wei, Yu Qiao, Zhen Qin","submitted_at":"2023-07-27T16:45:33Z","abstract_excerpt":"We present TransNormerLLM, the first linear attention-based Large Language Model (LLM) that outperforms conventional softmax attention-based models in terms of both accuracy and efficiency. TransNormerLLM evolves from the previous linear attention architecture TransNormer by making advanced modifications that include positional embedding, linear attention acceleration, gating mechanisms, tensor normalization, and inference acceleration and stabilization. Specifically, we use LRPE together with an exponential decay to avoid attention dilution issues while allowing the model to retain global int"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2307.14995","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2023-07-27T16:45:33Z","cross_cats_sorted":[],"title_canon_sha256":"17581c64c128bdfa37c2ad76c30a5546dbda757aee8e83d9ad556ccedd1b0ce9","abstract_canon_sha256":"e7a063a2e744479fbd7f03a5450412a950689324fa716dd339929623b24a8e68"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T07:35:19.950689Z","signature_b64":"RabXZMw6o73alDXBaRhrE1WhsV1rBS8Gpa6WcQdcTDwEZL540rau+1fluvfmD94aHY4ZEVR4WQUl1hTDDINaDA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"107c301f373095f95f5f6f3d7e251685c2437c74162d375be22d751f8f38e63d","last_reissued_at":"2026-07-05T07:35:19.950262Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T07:35:19.950262Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"TransNormerLLM: A Faster and Better Large Language Model with Improved TransNormer","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Baohong Lv, Dong Li, Weigao Sun, Weixuan Sun, Xiaodong Han, Xiao Luo, Xuyang Shen, Yiran Zhong, Yunshen Wei, Yu Qiao, Zhen Qin","submitted_at":"2023-07-27T16:45:33Z","abstract_excerpt":"We present TransNormerLLM, the first linear attention-based Large Language Model (LLM) that outperforms conventional softmax attention-based models in terms of both accuracy and efficiency. TransNormerLLM evolves from the previous linear attention architecture TransNormer by making advanced modifications that include positional embedding, linear attention acceleration, gating mechanisms, tensor normalization, and inference acceleration and stabilization. Specifically, we use LRPE together with an exponential decay to avoid attention dilution issues while allowing the model to retain global int"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2307.14995","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2307.14995/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2307.14995","created_at":"2026-07-05T07:35:19.950323+00:00"},{"alias_kind":"arxiv_version","alias_value":"2307.14995v2","created_at":"2026-07-05T07:35:19.950323+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2307.14995","created_at":"2026-07-05T07:35:19.950323+00:00"},{"alias_kind":"pith_short_12","alias_value":"CB6DAHZXGCK7","created_at":"2026-07-05T07:35:19.950323+00:00"},{"alias_kind":"pith_short_16","alias_value":"CB6DAHZXGCK7SX27","created_at":"2026-07-05T07:35:19.950323+00:00"},{"alias_kind":"pith_short_8","alias_value":"CB6DAHZX","created_at":"2026-07-05T07:35:19.950323+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":6,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.15079","citing_title":"Ling and Ring 2.6 Technical Report: Efficient and Instant Agentic Intelligence at Trillion-Parameter Scale","ref_index":229,"is_internal_anchor":false},{"citing_arxiv_id":"2507.09025","citing_title":"Lizard: An Efficient Linearization Framework for Large Language Models","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2510.27258","citing_title":"Higher-order Linear Attention","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2312.06635","citing_title":"Gated Linear Attention Transformers with Hardware-Efficient Training","ref_index":72,"is_internal_anchor":false},{"citing_arxiv_id":"2510.26692","citing_title":"Kimi Linear: An Expressive, Efficient Attention Architecture","ref_index":80,"is_internal_anchor":false},{"citing_arxiv_id":"2405.21060","citing_title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","ref_index":82,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/CB6DAHZXGCK7SX27N46X4JIWQX","json":"https://pith.science/pith/CB6DAHZXGCK7SX27N46X4JIWQX.json","graph_json":"https://pith.science/api/pith-number/CB6DAHZXGCK7SX27N46X4JIWQX/graph.json","events_json":"https://pith.science/api/pith-number/CB6DAHZXGCK7SX27N46X4JIWQX/events.json","paper":"https://pith.science/paper/CB6DAHZX"},"agent_actions":{"view_html":"https://pith.science/pith/CB6DAHZXGCK7SX27N46X4JIWQX","download_json":"https://pith.science/pith/CB6DAHZXGCK7SX27N46X4JIWQX.json","view_paper":"https://pith.science/paper/CB6DAHZX","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2307.14995&json=true","fetch_graph":"https://pith.science/api/pith-number/CB6DAHZXGCK7SX27N46X4JIWQX/graph.json","fetch_events":"https://pith.science/api/pith-number/CB6DAHZXGCK7SX27N46X4JIWQX/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/CB6DAHZXGCK7SX27N46X4JIWQX/action/timestamp_anchor","attest_storage":"https://pith.science/pith/CB6DAHZXGCK7SX27N46X4JIWQX/action/storage_attestation","attest_author":"https://pith.science/pith/CB6DAHZXGCK7SX27N46X4JIWQX/action/author_attestation","sign_citation":"https://pith.science/pith/CB6DAHZXGCK7SX27N46X4JIWQX/action/citation_signature","submit_replication":"https://pith.science/pith/CB6DAHZXGCK7SX27N46X4JIWQX/action/replication_record"}},"created_at":"2026-07-05T07:35:19.950323+00:00","updated_at":"2026-07-05T07:35:19.950323+00:00"}