{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:BQIEWTFYW7KH6PQEILV2VK7O4W","short_pith_number":"pith:BQIEWTFY","schema_version":"1.0","canonical_sha256":"0c104b4cb8b7d47f3e0442ebaaabeee5b15b61b5e76a0abcbde439f27dfa910b","source":{"kind":"arxiv","id":"2502.13842","version":2},"attestation_state":"computed","paper":{"title":"Inner Thinking Transformer: Leveraging Dynamic Depth Scaling to Foster Adaptive Internal Thinking","license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"HaiFeng Wang, Hua Wu, Jiawei Sheng, Junyuan Shang, Shuohuan Wang, Tingwen Liu, Yanxi Xie, Yilong Chen, Yu Sun, Zhenyu Zhang","submitted_at":"2025-02-19T16:02:23Z","abstract_excerpt":"Large language models (LLMs) face inherent performance bottlenecks under parameter constraints, particularly in processing critical tokens that demand complex reasoning. Empirical analysis reveals challenging tokens induce abrupt gradient spikes across layers, exposing architectural stress points in standard Transformers. Building on this insight, we propose Inner Thinking Transformer (ITT), which reimagines layer computations as implicit thinking steps. ITT dynamically allocates computation through Adaptive Token Routing, iteratively refines representations via Residual Thinking Connections, "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2502.13842","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","primary_cat":"cs.CL","submitted_at":"2025-02-19T16:02:23Z","cross_cats_sorted":[],"title_canon_sha256":"8a9349466b3e15145c22f62bcd8247f249d0ec963705075627938c323b6913fe","abstract_canon_sha256":"28c5ee69330d4af18c54dfa5514d356841583a2e4ee8648541127a294d2d5780"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:18:51.072333Z","signature_b64":"FKkeJmqLojxHFV8HJvO1Le76QoDBtLCD+nYzjJfQRWKxaA8i2NLOuPGjesBDVQT/+ygzp4Gi+h7HNy4mGrvdAQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"0c104b4cb8b7d47f3e0442ebaaabeee5b15b61b5e76a0abcbde439f27dfa910b","last_reissued_at":"2026-07-05T10:18:51.071778Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:18:51.071778Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Inner Thinking Transformer: Leveraging Dynamic Depth Scaling to Foster Adaptive Internal Thinking","license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"HaiFeng Wang, Hua Wu, Jiawei Sheng, Junyuan Shang, Shuohuan Wang, Tingwen Liu, Yanxi Xie, Yilong Chen, Yu Sun, Zhenyu Zhang","submitted_at":"2025-02-19T16:02:23Z","abstract_excerpt":"Large language models (LLMs) face inherent performance bottlenecks under parameter constraints, particularly in processing critical tokens that demand complex reasoning. Empirical analysis reveals challenging tokens induce abrupt gradient spikes across layers, exposing architectural stress points in standard Transformers. Building on this insight, we propose Inner Thinking Transformer (ITT), which reimagines layer computations as implicit thinking steps. ITT dynamically allocates computation through Adaptive Token Routing, iteratively refines representations via Residual Thinking Connections, "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2502.13842","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2502.13842/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2502.13842","created_at":"2026-07-05T10:18:51.071845+00:00"},{"alias_kind":"arxiv_version","alias_value":"2502.13842v2","created_at":"2026-07-05T10:18:51.071845+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2502.13842","created_at":"2026-07-05T10:18:51.071845+00:00"},{"alias_kind":"pith_short_12","alias_value":"BQIEWTFYW7KH","created_at":"2026-07-05T10:18:51.071845+00:00"},{"alias_kind":"pith_short_16","alias_value":"BQIEWTFYW7KH6PQE","created_at":"2026-07-05T10:18:51.071845+00:00"},{"alias_kind":"pith_short_8","alias_value":"BQIEWTFY","created_at":"2026-07-05T10:18:51.071845+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":9,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.10184","citing_title":"Dropout-GRPO: Variational Stochasticity for Continuous Latent Reasoning","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2606.06574","citing_title":"Skip a Layer or Loop It? Learning Program-of-Layers in LLMs","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2504.02181","citing_title":"A Survey of Scaling in Large Language Model Reasoning","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2602.21750","citing_title":"From Words to Amino Acids: Does the Curse of Depth Persist?","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2510.25741","citing_title":"Scaling Latent Reasoning via Looped Language Models","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2603.29057","citing_title":"LA-Sign: Looped Transformers with Geometry-aware Alignment for Skeleton-based Sign Language Recognition","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2503.16419","citing_title":"Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2503.09567","citing_title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","ref_index":112,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06165","citing_title":"Post Reasoning: Improving the Performance of Non-Thinking Models at No Cost","ref_index":106,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/BQIEWTFYW7KH6PQEILV2VK7O4W","json":"https://pith.science/pith/BQIEWTFYW7KH6PQEILV2VK7O4W.json","graph_json":"https://pith.science/api/pith-number/BQIEWTFYW7KH6PQEILV2VK7O4W/graph.json","events_json":"https://pith.science/api/pith-number/BQIEWTFYW7KH6PQEILV2VK7O4W/events.json","paper":"https://pith.science/paper/BQIEWTFY"},"agent_actions":{"view_html":"https://pith.science/pith/BQIEWTFYW7KH6PQEILV2VK7O4W","download_json":"https://pith.science/pith/BQIEWTFYW7KH6PQEILV2VK7O4W.json","view_paper":"https://pith.science/paper/BQIEWTFY","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2502.13842&json=true","fetch_graph":"https://pith.science/api/pith-number/BQIEWTFYW7KH6PQEILV2VK7O4W/graph.json","fetch_events":"https://pith.science/api/pith-number/BQIEWTFYW7KH6PQEILV2VK7O4W/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/BQIEWTFYW7KH6PQEILV2VK7O4W/action/timestamp_anchor","attest_storage":"https://pith.science/pith/BQIEWTFYW7KH6PQEILV2VK7O4W/action/storage_attestation","attest_author":"https://pith.science/pith/BQIEWTFYW7KH6PQEILV2VK7O4W/action/author_attestation","sign_citation":"https://pith.science/pith/BQIEWTFYW7KH6PQEILV2VK7O4W/action/citation_signature","submit_replication":"https://pith.science/pith/BQIEWTFYW7KH6PQEILV2VK7O4W/action/replication_record"}},"created_at":"2026-07-05T10:18:51.071845+00:00","updated_at":"2026-07-05T10:18:51.071845+00:00"}