{"as_of":"2026-08-16T15:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:349a553497c3731e16ce5e146a88f3b130962d4b0098ab0826e8b03615499227","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:25:35.727421Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.00434/citation-record","integrity":"/paper/2608.00434/integrity","json":"/paper/2608.00434/citation-record.json","paper":"/paper/2608.00434"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:25:35.488365Z","title":"arXiv preprint arXiv:2505.17505 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.488365Z"},"links":{"citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:556dffbf238da62c620ebd8511ed619baaff0aac52c6c036c562209b5b4675dd","observation_id":"6ca8042f-fe68-43f0-95c0-6a4cae5f0e81","resolution":{"observed_at":"2026-08-15T15:25:35.488365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10518","last_updated":"2025-05-15T17:25:03Z","snapshot_observed_at":"2026-08-15T21:05:34.584174Z","submitted_at":"2025-05-15T17:25:03Z","title":"Multi-Token Prediction Needs Registers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10518","snapshot_observed_at":"2026-08-15T15:25:35.492948Z","title":"arXiv preprint arXiv:2505.10518 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.492948Z"},"links":{"cited_paper":"/paper/2505.10518","citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:bff512922e5151c3159c57a834bd98dcbffa9778da494326ce84c64c18fc50ad","observation_id":"b15b3e1e-1ce3-4422-a3d1-93d64aaf5815","resolution":{"observed_at":"2026-08-15T15:25:35.492948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17765","last_updated":"2025-02-10T09:58:34Z","snapshot_observed_at":"2026-08-16T13:06:40.249179Z","submitted_at":"2024-10-23T11:06:36Z","title":"Faster Language Models with Better Multi-Token Prediction Using Tensor Decomposition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17765","snapshot_observed_at":"2026-08-15T15:25:35.497472Z","title":"arXiv preprint arXiv:2410.17765 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.497472Z"},"links":{"cited_paper":"/paper/2410.17765","citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:4028a0e21456402f1010be49f9814f6219d1b75757b3ae847fbb539f0ce826cf","observation_id":"4af58e76-e53f-4e04-abac-96ec96e0b318","resolution":{"observed_at":"2026-08-15T15:25:35.497472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:25:35.502284Z","title":"arXiv preprint arXiv:2510.14751 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.502284Z"},"links":{"citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:517309d7812eef5150a3eaa0ab3643a927e317f7905c25bee136c8b2881170a1","observation_id":"fddb3267-0753-401d-a3bc-791dfcf6b3f7","resolution":{"observed_at":"2026-08-15T15:25:35.502284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19737","last_updated":"2024-04-30T17:33:57Z","snapshot_observed_at":"2026-08-16T14:11:52.376290Z","submitted_at":"2024-04-30T17:33:57Z","title":"Better & Faster Large Language Models via Multi-token Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19737","snapshot_observed_at":"2026-08-15T15:25:35.506809Z","title":"arXiv preprint arXiv:2404.19737 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.506809Z"},"links":{"cited_paper":"/paper/2404.19737","citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:fb6ffa3ce7ea58a70abfca9b84dc7b01d3dd227b388fce8b3c38f6e6bb5f311f","observation_id":"ab5214b2-cd6d-42a0-b2d6-dabf286e9e62","resolution":{"observed_at":"2026-08-15T15:25:35.506809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:25:35.511445Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.511445Z"},"links":{"citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:27be268c64d4fa733391cf830d25a32ee8faf9c6dc699fb21f1a9e78ff0b6ba7","observation_id":"cb42265e-5eeb-47ad-bdfb-2e05c2109b78","resolution":{"observed_at":"2026-08-15T15:25:35.511445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-15T15:25:35.515460Z","title":"arXiv preprint arXiv:2412.19437 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.515460Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:81b4bd19f15a0b339b42b7792b239b6012911ea2065142f02d071862734f2067","observation_id":"ff1c6df5-af5c-4786-b8cb-c9c05f5430d5","resolution":{"observed_at":"2026-08-15T15:25:35.515460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:25:35.520379Z","title":"arXiv preprint arXiv:2512.24617 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.520379Z"},"links":{"citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:460b6294908a41cdc2b843e9ef52392492bfc03aaaa1e28d223b4c727dd949ab","observation_id":"8c78a3ba-b27a-42dc-8fae-fe74713e6b4b","resolution":{"observed_at":"2026-08-15T15:25:35.520379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21801","last_updated":"2025-03-24T19:52:42Z","snapshot_observed_at":"2026-08-16T12:47:12.377205Z","submitted_at":"2025-03-24T19:52:42Z","title":"Efficient Joint Prediction of Multiple Future Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21801","snapshot_observed_at":"2026-08-15T15:25:35.525235Z","title":"arXiv preprint arXiv:2503.21801 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.525235Z"},"links":{"cited_paper":"/paper/2503.21801","citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:4bd6a6f5e79d7bcb240c5a5cd300576daf8fd05218666b0f6ca39773b7199801","observation_id":"59b27054-2001-4abb-bfbd-55df76adbf8b","resolution":{"observed_at":"2026-08-15T15:25:35.525235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:25:35.529828Z","title":"arXiv preprint arXiv:2509.18362 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.529828Z"},"links":{"citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:97acd2cf2f9e4fbafbbaf2a3492d5793635ace769cbba90a2b79ebce3ec61a01","observation_id":"7901a405-6c62-489d-a70e-1292971f33c1","resolution":{"observed_at":"2026-08-15T15:25:35.529828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10774","last_updated":"2024-06-14T23:32:32Z","snapshot_observed_at":"2026-07-06T17:17:56.276857Z","submitted_at":"2024-01-19T15:48:40Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10774","snapshot_observed_at":"2026-08-15T15:25:35.533490Z","title":"arXiv preprint arXiv:2401.10774 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.533490Z"},"links":{"cited_paper":"/paper/2401.10774","citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:78aa7de255decac7f6809c5d64ed0d18f737e02f96429c1dc0cd249bce6f0a53","observation_id":"9e6ae26b-e742-4625-9c4d-5d6be734e0cd","resolution":{"observed_at":"2026-08-15T15:25:35.533490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:25:35.540077Z","title":"arXiv preprint arXiv:2508.19228 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.540077Z"},"links":{"citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:167a4405cfca654dc8a72f6ed7c3699a582a315f28fb2828681f4f9fe41c395b","observation_id":"fae43951-a2c7-4818-9d31-503092c9033b","resolution":{"observed_at":"2026-08-15T15:25:35.540077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.11851","last_updated":"2025-07-16T02:31:40Z","snapshot_observed_at":"2026-08-13T01:40:25.997863Z","submitted_at":"2025-07-16T02:31:40Z","title":"Your LLM Knows the Future: Uncovering Its Multi-Token Prediction Potential","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.11851","snapshot_observed_at":"2026-08-15T15:25:35.544478Z","title":"arXiv preprint arXiv:2507.11851 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.544478Z"},"links":{"cited_paper":"/paper/2507.11851","citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:1e669287c92e9ae45e05c05272873e392ca3579367e249ef23d6d1d2ab28b3e1","observation_id":"11058976-3e5b-4c53-aeca-19444d6933a2","resolution":{"observed_at":"2026-08-15T15:25:35.544478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07608","last_updated":"2025-06-05T11:49:09Z","snapshot_observed_at":"2026-08-15T22:10:10.561015Z","submitted_at":"2025-05-12T14:30:11Z","title":"MiMo: Unlocking the Reasoning Potential of Language Model -- From Pretraining to Posttraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07608","snapshot_observed_at":"2026-08-15T15:25:35.548459Z","title":"arXiv preprint arXiv:2505.07608 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.548459Z"},"links":{"cited_paper":"/paper/2505.07608","citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:591f3af40943a04d8eebb674570a7637dff68f1fb78f9097f577ae357bfd9b1d","observation_id":"a0425c5c-cd91-4de9-9fb7-6485cfb8a0b1","resolution":{"observed_at":"2026-08-15T15:25:35.548459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:25:36.832125Z","title":"Findings of the Association for Computational Linguistics: EMNLP 2020 , pages=","venue":null,"work_id":"3c55e3a9-fae4-4a15-bf18-a6607b4a8470","year":2020},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.552740Z"},"links":{"citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:859fa4555040acf242ba018568dde20d26f53ea4e892e02b037e46cb56f512c3","observation_id":"49e34df3-9ec8-4be1-bd75-ee6fc9069bf1","resolution":{"observed_at":"2026-08-15T15:25:36.836408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:25:35.556471Z","title":"journal of machine learning research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.556471Z"},"links":{"citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:901c5dcd0728643cce2b8c597831f5fa8437cb8bae869d76c9f871ab3335a4ce","observation_id":"8305692f-b842-403e-ae79-19833b7bd8f4","resolution":{"observed_at":"2026-08-15T15:25:35.556471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-16T15:24:21.726803Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-08-15T15:25:35.561194Z","title":"arXiv preprint arXiv:2306.07629 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.561194Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:51003470a6e839bc0aa06fb1fe665f1d853cfa94f184a0c855ba4863cef6a372","observation_id":"97eec831-accd-4d0d-81d9-b292476d3de8","resolution":{"observed_at":"2026-08-15T15:25:35.561194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:25:35.565402Z","title":"Proceedings of machine learning and systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.565402Z"},"links":{"citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:dcf1019fa1cd7f9a553521a0379c0c1b358ca174288467568aa4624e51457874","observation_id":"b7a82594-e9ac-4fc4-80ea-f36e7ceb11bb","resolution":{"observed_at":"2026-08-15T15:25:35.565402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:25:35.569367Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.569367Z"},"links":{"citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:6acfcfe8cb95bbfe631b5202ba5a14da065050c14c29d5e868c6134aa5ff8927","observation_id":"7216b7b8-fb1a-45ea-98d3-c39d1f76900a","resolution":{"observed_at":"2026-08-15T15:25:35.569367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:25:36.802110Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"6269de23-9222-4751-86a8-576ed6822225","year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.573313Z"},"links":{"citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:eba17c4e2b089d6460965e0131d75091e246ee8d4c5f59f259ca2ff877c1f30e","observation_id":"cdb2b6dc-7b8a-43fd-968b-b0030e0584f8","resolution":{"observed_at":"2026-08-15T15:25:36.805981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:25:35.577111Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.577111Z"},"links":{"citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:b9cadcca41e317616d946b2bbc5d642fc62665bdb99813c57c5471dee01abd9c","observation_id":"9197c0e0-8b5d-4333-9d4e-92b4ba92d94f","resolution":{"observed_at":"2026-08-15T15:25:35.577111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11695","last_updated":"2024-05-06T17:47:01Z","snapshot_observed_at":"2026-08-13T04:32:33.562415Z","submitted_at":"2023-06-20T17:18:20Z","title":"A Simple and Effective Pruning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11695","snapshot_observed_at":"2026-08-15T15:25:35.581263Z","title":"arXiv preprint arXiv:2306.11695 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.581263Z"},"links":{"cited_paper":"/paper/2306.11695","citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:f0cc76de865509d1b4cd9c7e42537dbf727ac9b643581b341e9b4d30521d560a","observation_id":"cf1ec5e0-6419-4e95-9a30-a9d11bec1ba8","resolution":{"observed_at":"2026-08-15T15:25:35.581263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08543","last_updated":"2026-01-31T09:16:35Z","snapshot_observed_at":"2026-08-16T00:37:04.298248Z","submitted_at":"2023-06-14T14:44:03Z","title":"MiniLLM: On-Policy Distillation of Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08543","snapshot_observed_at":"2026-08-15T15:25:35.584918Z","title":"arXiv preprint arXiv:2306.08543 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.584918Z"},"links":{"cited_paper":"/paper/2306.08543","citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:3c8ac5ff522b2dc664ac1e073af967b92864829a6d0d281751785325831a5a9f","observation_id":"0b6e21e7-5dcb-461b-ba01-d2f755056a13","resolution":{"observed_at":"2026-08-15T15:25:35.584918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-14T22:57:08.956233Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-15T15:25:35.588779Z","title":"arXiv preprint arXiv:1503.02531 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.588779Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:60c9893c2aee70c965c1800436afa24973c9b80ed99ab2b4ff141a131edb57e6","observation_id":"c0b25a40-0d95-4f6e-8990-46ce33cdf93d","resolution":{"observed_at":"2026-08-15T15:25:35.588779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03277","last_updated":"2023-04-06T17:58:09Z","snapshot_observed_at":"2026-08-16T13:26:40.822276Z","submitted_at":"2023-04-06T17:58:09Z","title":"Instruction Tuning with GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03277","snapshot_observed_at":"2026-08-15T15:25:35.593350Z","title":"arXiv preprint arXiv:2304.03277 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.593350Z"},"links":{"cited_paper":"/paper/2304.03277","citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:a7b187fc84bb700e6a83c791a02bed133d333132e0e998a31a45f341b6e7e270","observation_id":"684808a8-7cb9-42a2-99f7-92cb59bca5ca","resolution":{"observed_at":"2026-08-15T15:25:35.593350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:25:35.597216Z","title":"Findings of the Association for Computational Linguistics: ACL 2023 , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.597216Z"},"links":{"citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:f76baee0e1f31a52bc26764cc396002654e558637278e57582b707f3dd7abdd8","observation_id":"9352eff0-d483-4feb-b47b-8d8aa54f07d0","resolution":{"observed_at":"2026-08-15T15:25:35.597216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:25:35.601190Z","title":"Proceedings of the 61st annual meeting of the association for computational linguistics (volume 1: long papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.601190Z"},"links":{"citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:5d5d80b5102e308dc4963e5ba4d8efc1fa96bd5778706b41be90e09d3f360dbc","observation_id":"47e84ab0-6e18-4f92-9d22-cee4dac4cd70","resolution":{"observed_at":"2026-08-15T15:25:35.601190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:25:35.604775Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.604775Z"},"links":{"citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:ae19c0751f72a053840a3d476d5d626992c4477212a92b5787f099960740635b","observation_id":"2754cfba-0c70-4c6b-b757-e3c30c72157f","resolution":{"observed_at":"2026-08-15T15:25:35.604775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:25:35.608730Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.608730Z"},"links":{"citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:e9e8b8ae7fbcd3a51f21c5a810c412fce94588a9836ba7378e2f52fefb8d7ab3","observation_id":"68b7cbdc-223d-4165-9389-3710a91fcd55","resolution":{"observed_at":"2026-08-15T15:25:35.608730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-16T10:03:03.268538Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-15T15:25:35.613055Z","title":"arXiv preprint arXiv:1904.10509 , year=","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.613055Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:ff26c914d9e67fbf8d5f67a2a47113da82adadee95805d65719203e8ad949e1b","observation_id":"81b89411-4885-4e9d-b25b-3f9bfe3fb54e","resolution":{"observed_at":"2026-08-15T15:25:35.613055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-08-12T19:30:23.025771Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-08-15T15:25:35.617482Z","title":"arXiv preprint arXiv:2502.13189 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.617482Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:d95d79e1a2645d41cc9710b5fd39864325000c783f713722d5f18fd3f359ffd5","observation_id":"07f1da7e-6c0b-4e28-a59a-6fc269ebb59f","resolution":{"observed_at":"2026-08-15T15:25:35.617482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-15T15:25:35.621851Z","title":"arXiv preprint arXiv:2405.04434 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.621851Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:2b67bf9ad8e7de2b28cd445f5896e6a716f988c2999cea5933d8a248b542e229","observation_id":"4341a82d-73e1-40df-a8f2-61b47b70508f","resolution":{"observed_at":"2026-08-15T15:25:35.621851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:25:35.626115Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.626115Z"},"links":{"citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:e962f2fe2f1421a6a6b317ee9af344220a2c5c2496c93871955341399318bd9c","observation_id":"4578af6f-bcc6-41b3-8bf3-a61977e00d1f","resolution":{"observed_at":"2026-08-15T15:25:35.626115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-15T15:25:35.629844Z","title":"arXiv preprint arXiv:2307.08691 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.629844Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:cb688f0ebd367791452289fe40d22a3042c4d501b88afcf715af17ada4c2cf9c","observation_id":"93a6d0a6-88c6-4d2c-a717-34668cd039cd","resolution":{"observed_at":"2026-08-15T15:25:35.629844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:25:35.634067Z","title":"Proceedings of the 29th symposium on operating systems principles , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.634067Z"},"links":{"citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:32e50ba36e017acb63c99872b642ecfcfb0fe33e6625294d9fba6ce88618b9a7","observation_id":"c4b3350b-d095-4e51-a2ee-e117f5dcb70f","resolution":{"observed_at":"2026-08-15T15:25:35.634067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:25:35.638626Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.638626Z"},"links":{"citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:8e7ef80666204813291ecda84eb60e5191b9d5d765aa3498cac03e9a794ab299","observation_id":"7f4fc9a8-475d-48af-bd96-b1dbe02f3a2f","resolution":{"observed_at":"2026-08-15T15:25:35.638626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:25:35.642428Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.642428Z"},"links":{"citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:b3f5bc91205e5e90eef8e7d2429539cbbb71acc647ab86bc9f4842e39f7b6330","observation_id":"417c9b87-6b3d-4572-9a70-c8128b0923aa","resolution":{"observed_at":"2026-08-15T15:25:35.642428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01318","last_updated":"2023-02-02T18:44:11Z","snapshot_observed_at":"2026-08-13T23:55:57.074762Z","submitted_at":"2023-02-02T18:44:11Z","title":"Accelerating Large Language Model Decoding with Speculative Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01318","snapshot_observed_at":"2026-08-15T15:25:35.646913Z","title":"arXiv preprint arXiv:2302.01318 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.646913Z"},"links":{"cited_paper":"/paper/2302.01318","citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:4b25c39ba0052f4939c7d9f4d83d26d8d2c4c964227eaf7ce495f4d2d8623973","observation_id":"9308dce7-57e6-4084-bbbc-044c91fdb25e","resolution":{"observed_at":"2026-08-15T15:25:35.646913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:25:36.728857Z","title":"CCF International Conference on Natural Language Processing and Chinese Computing , pages=","venue":null,"work_id":"34dcd69c-734f-4f0c-95f6-da2adebcdca1","year":2025},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.651547Z"},"links":{"citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:31d3e951d4de7fba08461ca934c65db63555e918847f2ac8519889c464d874d1","observation_id":"affac131-8332-409d-85cf-12b8e3c40c94","resolution":{"observed_at":"2026-08-15T15:25:36.733156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08461","last_updated":"2024-03-31T03:06:51Z","snapshot_observed_at":"2026-08-16T14:52:38.095793Z","submitted_at":"2023-10-12T16:21:04Z","title":"DistillSpec: Improving Speculative Decoding via Knowledge Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08461","snapshot_observed_at":"2026-08-15T15:25:35.655628Z","title":"arXiv preprint arXiv:2310.08461 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.655628Z"},"links":{"cited_paper":"/paper/2310.08461","citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:418ded8d31298eabe7692426856028cfeb2e8117d43083e7d1a1d1b8faec0924","observation_id":"0d9a0d3b-0c2d-4d8f-bcde-c13d645c6218","resolution":{"observed_at":"2026-08-15T15:25:35.655628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:25:35.660295Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.660295Z"},"links":{"citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:c9e88949910fc428a4a1ace6e583e451283bcdc6a50a5f3070946c0579ea0e5f","observation_id":"eacf1cdc-5280-41d9-8bb3-33c2eec32f08","resolution":{"observed_at":"2026-08-15T15:25:35.660295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15077","last_updated":"2025-03-04T13:58:39Z","snapshot_observed_at":"2026-08-03T09:40:31.365295Z","submitted_at":"2024-01-26T18:59:01Z","title":"EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15077","snapshot_observed_at":"2026-08-15T15:25:35.664561Z","title":"arXiv preprint arXiv:2401.15077 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.664561Z"},"links":{"cited_paper":"/paper/2401.15077","citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:df4e5839af2bec70ea37486043248a4add26f4be02afd8b3c175fd434d73b671","observation_id":"c1e56746-f9a9-4d69-baeb-e4335031de2b","resolution":{"observed_at":"2026-08-15T15:25:35.664561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:25:35.668809Z","title":"Proceedings of the 29th ACM International Conference on Architectural Support for Programming Languages and Operating Systems, Volume 3 , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.668809Z"},"links":{"citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:993f427df3d7f0c28bfb4a69023d010b1d49312b036322c98bf4b8c4167a56c1","observation_id":"05d3129c-804f-49f8-a138-9d38188f3620","resolution":{"observed_at":"2026-08-15T15:25:35.668809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:25:36.701191Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"6e20ad8d-5785-4cf7-8c73-2e55de24ee8e","year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.672899Z"},"links":{"citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:0655a52697667b2b864b16e299be77216281ea78ff02d0fbf64216bf3a7233ea","observation_id":"09811252-cabc-45a1-9504-239f8a8f959f","resolution":{"observed_at":"2026-08-15T15:25:36.706553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08821","last_updated":"2024-12-15T21:20:12Z","snapshot_observed_at":"2026-08-16T08:10:37.041600Z","submitted_at":"2024-12-11T23:36:20Z","title":"Large Concept Models: Language Modeling in a Sentence Representation Space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08821","snapshot_observed_at":"2026-08-15T15:25:35.677765Z","title":"arXiv preprint arXiv:2412.08821 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.677765Z"},"links":{"cited_paper":"/paper/2412.08821","citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:0e16483d4ad262dd67828ff9a2dc8e9d43778462482bc122f3c0aabc361e8ccc","observation_id":"55ee1ba7-a582-4b59-8970-58ca9abebb03","resolution":{"observed_at":"2026-08-15T15:25:35.677765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-15T15:25:35.683168Z","title":"arXiv preprint arXiv:2103.03874 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.683168Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:c673b92ba297c42132aeaec86e9326d8e858eb0e20caba5bd6a05cd05ffc1f31","observation_id":"c365b461-3df8-4e58-8af3-f790fd444351","resolution":{"observed_at":"2026-08-15T15:25:35.683168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08568","last_updated":"2025-05-27T07:40:36Z","snapshot_observed_at":"2026-08-16T15:23:56.097387Z","submitted_at":"2023-06-14T15:18:48Z","title":"WizardCoder: Empowering Code Large Language Models with Evol-Instruct","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08568","snapshot_observed_at":"2026-08-15T15:25:35.687143Z","title":"arXiv preprint arXiv:2306.08568 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.687143Z"},"links":{"cited_paper":"/paper/2306.08568","citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:bd46207d08cf2633fc8a833cc0c2889c6b38a295f2d7834b43cf1704003cfaa1","observation_id":"96ab64fb-ae7a-442a-ab22-c86884bbc001","resolution":{"observed_at":"2026-08-15T15:25:35.687143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:25:35.691476Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.691476Z"},"links":{"citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:9dbc4f05f4e706073eb3991f32eac01b5e4cde27831b71eed7cbff5f76984fb2","observation_id":"dab79e4b-f641-400a-8fc0-638e4099e2a3","resolution":{"observed_at":"2026-08-15T15:25:35.691476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:25:35.696223Z","title":"The twelfth international conference on learning representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.696223Z"},"links":{"citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:8943f54574bfb756dcfb32d35f1f0242747b8568d8be5745573269a9edc494d8","observation_id":"eabc3651-6d29-4a61-abc5-e0370d1727db","resolution":{"observed_at":"2026-08-15T15:25:35.696223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-15T15:25:35.700300Z","title":"arXiv preprint arXiv:2110.14168 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.700300Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:64b38d9d36aea2e8a17a81f3ed0decd2b386c43c5bdb172694c043f89d39b104","observation_id":"b11c1ef7-37a2-4809-bf71-58caf832463d","resolution":{"observed_at":"2026-08-15T15:25:35.700300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-15T17:40:38.050939Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-15T15:25:35.704273Z","title":"arXiv preprint arXiv:2108.07732 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.704273Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:52b1d40bbf91b920709bac6329f66b6a6d5a7487d4763737b18debd726827cba","observation_id":"8c450dd1-3485-47e4-9749-6d5e12d3efb1","resolution":{"observed_at":"2026-08-15T15:25:35.704273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:25:35.708837Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.708837Z"},"links":{"citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:7fc421103c4e20a4d08760d2961f502c2f22f165d321cec78236e1df006cb9ec","observation_id":"56d7718e-3358-42a4-ad22-98e782a646cf","resolution":{"observed_at":"2026-08-15T15:25:35.708837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-15T15:25:35.713859Z","title":"arXiv preprint arXiv:2107.03374 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.713859Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:48c3b0279cab02a5c1e3e45c1b440b639ca621112d41e1ec57ea2c887f81c400","observation_id":"479bba2b-2309-4c94-acf7-449e546e8d59","resolution":{"observed_at":"2026-08-15T15:25:35.713859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-15T15:25:35.718483Z","title":"arXiv preprint arXiv:2009.03300 , year=","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.718483Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:28dc9d82152646f07672dd3509ba804030fa7968a229dbb40b422806b6369225","observation_id":"b2c7d324-7caa-48f1-aa34-ad9b4fa3b362","resolution":{"observed_at":"2026-08-15T15:25:35.718483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-15T15:25:35.722864Z","title":"arXiv preprint arXiv:2311.07911 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.722864Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:2b5c2e91b20a1fd39c0bee5c9dfcec35c50e9aa44892b16b4d9efb2098b19e27","observation_id":"66c737ae-6767-43ff-986b-b459f46ab715","resolution":{"observed_at":"2026-08-15T15:25:35.722864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:25:35.727421Z","title":", author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T15:25:35.727421Z"},"links":{"citing_paper":"/paper/2608.00434"},"observation_digest":"sha256:93c77daa3067708a91101bc6b51f56cb85ef5d206cf01130072505f8939afcae","observation_id":"172356cb-0b9d-4c88-af09-8d1cb59fc6b5","resolution":{"observed_at":"2026-08-15T15:25:35.727421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.00434","last_updated":"2026-08-01T04:18:49Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T12:41:49.307108Z","submitted_at":"2026-08-01T04:18:49Z","title":"AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2608.00434."}