{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:34FDQA4MVUT2TKEOMRGS5WOWCB","short_pith_number":"pith:34FDQA4M","schema_version":"1.0","canonical_sha256":"df0a38038cad27a9a88e644d2ed9d61065ec26ceeec76e598046bbc6ee0ba450","source":{"kind":"arxiv","id":"2507.11851","version":1},"attestation_state":"computed","paper":{"title":"Your LLM Knows the Future: Uncovering Its Multi-Token Prediction Potential","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CL","authors_text":"Arnav Kundu, David Harrison, Devang Naik, Kumari Nishu, Mehrdad Farajtabar, Minsik Cho, Mohammad Samragh","submitted_at":"2025-07-16T02:31:40Z","abstract_excerpt":"Autoregressive language models are constrained by their inherently sequential nature, generating one token at a time. This paradigm limits inference speed and parallelism, especially during later stages of generation when the direction and semantics of text are relatively certain. In this work, we propose a novel framework that leverages the inherent knowledge of vanilla autoregressive language models about future tokens, combining techniques to realize this potential and enable simultaneous prediction of multiple subsequent tokens. Our approach introduces several key innovations: (1) a masked"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2507.11851","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2025-07-16T02:31:40Z","cross_cats_sorted":["cs.LG"],"title_canon_sha256":"fb6a30e3823989acd93f207ced6a8b40e7eb77f9fb3c5de85e18eeabb6c6cb45","abstract_canon_sha256":"809d6a4093b58f7d0c5ef14b5a5d80c6211b6d23d6520a0e60265fb4df2c3f1e"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:37:52.102935Z","signature_b64":"SmTBQ9D+sTafs7rmILy7x/SCHg4d3l8xVwX0EscYTlBmdP/ZiWkYBVar1cgrtUIO8GzCY0qvJ2Cju4oXqur9DA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"df0a38038cad27a9a88e644d2ed9d61065ec26ceeec76e598046bbc6ee0ba450","last_reissued_at":"2026-07-05T11:37:52.102403Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:37:52.102403Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Your LLM Knows the Future: Uncovering Its Multi-Token Prediction Potential","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CL","authors_text":"Arnav Kundu, David Harrison, Devang Naik, Kumari Nishu, Mehrdad Farajtabar, Minsik Cho, Mohammad Samragh","submitted_at":"2025-07-16T02:31:40Z","abstract_excerpt":"Autoregressive language models are constrained by their inherently sequential nature, generating one token at a time. This paradigm limits inference speed and parallelism, especially during later stages of generation when the direction and semantics of text are relatively certain. In this work, we propose a novel framework that leverages the inherent knowledge of vanilla autoregressive language models about future tokens, combining techniques to realize this potential and enable simultaneous prediction of multiple subsequent tokens. Our approach introduces several key innovations: (1) a masked"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2507.11851","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2507.11851/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2507.11851","created_at":"2026-07-05T11:37:52.102471+00:00"},{"alias_kind":"arxiv_version","alias_value":"2507.11851v1","created_at":"2026-07-05T11:37:52.102471+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2507.11851","created_at":"2026-07-05T11:37:52.102471+00:00"},{"alias_kind":"pith_short_12","alias_value":"34FDQA4MVUT2","created_at":"2026-07-05T11:37:52.102471+00:00"},{"alias_kind":"pith_short_16","alias_value":"34FDQA4MVUT2TKEO","created_at":"2026-07-05T11:37:52.102471+00:00"},{"alias_kind":"pith_short_8","alias_value":"34FDQA4M","created_at":"2026-07-05T11:37:52.102471+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":12,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.05722","citing_title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","ref_index":7,"is_internal_anchor":true},{"citing_arxiv_id":"2605.24956","citing_title":"NITP: Next Implicit Token Prediction for LLM Pre-training","ref_index":40,"is_internal_anchor":false},{"citing_arxiv_id":"2606.10820","citing_title":"K-Forcing: Joint Next-K-Token Decoding via Push-Forward Language Modeling","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2606.08633","citing_title":"Towards Long-Horizon Vessel Trajectory and Destination Forecasting with Reasoning Large Language Models","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2606.31315","citing_title":"BlockPilot: Instance-Adaptive Policy Learning for Diffusion-based Speculative Decoding","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2605.24956","citing_title":"NITP: Next Implicit Token Prediction for LLM Pre-training","ref_index":40,"is_internal_anchor":false},{"citing_arxiv_id":"2605.25745","citing_title":"Selective Latent Thinking: Adaptive Compression of LLM Reasoning Chains","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2605.29727","citing_title":"Bastion: Budget-Aware Speculative Decoding with Tree-structured Block Diffusion Drafting","ref_index":52,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20022","citing_title":"FlexDraft: Flexible Speculative Decoding via Attention Tuning and Bonus-Guided Calibration","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2605.16709","citing_title":"Covert Multi-bit LLM Watermarking: An Information Theory and Coding Approach","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2602.06019","citing_title":"Multi-Token Prediction via Self-Distillation","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2604.11912","citing_title":"How Transformers Learn to Plan via Multi-Token Prediction","ref_index":10,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/34FDQA4MVUT2TKEOMRGS5WOWCB","json":"https://pith.science/pith/34FDQA4MVUT2TKEOMRGS5WOWCB.json","graph_json":"https://pith.science/api/pith-number/34FDQA4MVUT2TKEOMRGS5WOWCB/graph.json","events_json":"https://pith.science/api/pith-number/34FDQA4MVUT2TKEOMRGS5WOWCB/events.json","paper":"https://pith.science/paper/34FDQA4M"},"agent_actions":{"view_html":"https://pith.science/pith/34FDQA4MVUT2TKEOMRGS5WOWCB","download_json":"https://pith.science/pith/34FDQA4MVUT2TKEOMRGS5WOWCB.json","view_paper":"https://pith.science/paper/34FDQA4M","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2507.11851&json=true","fetch_graph":"https://pith.science/api/pith-number/34FDQA4MVUT2TKEOMRGS5WOWCB/graph.json","fetch_events":"https://pith.science/api/pith-number/34FDQA4MVUT2TKEOMRGS5WOWCB/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/34FDQA4MVUT2TKEOMRGS5WOWCB/action/timestamp_anchor","attest_storage":"https://pith.science/pith/34FDQA4MVUT2TKEOMRGS5WOWCB/action/storage_attestation","attest_author":"https://pith.science/pith/34FDQA4MVUT2TKEOMRGS5WOWCB/action/author_attestation","sign_citation":"https://pith.science/pith/34FDQA4MVUT2TKEOMRGS5WOWCB/action/citation_signature","submit_replication":"https://pith.science/pith/34FDQA4MVUT2TKEOMRGS5WOWCB/action/replication_record"}},"created_at":"2026-07-05T11:37:52.102471+00:00","updated_at":"2026-07-05T11:37:52.102471+00:00"}