{"as_of":"2026-08-05T18:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:603175eef0977b6f295f1bcb3e89718d0a03487b56eda4131b2460a5053d43c1","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T18:45:28.635910Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.24956/citation-record","integrity":"/paper/2605.24956/integrity","json":"/paper/2605.24956/citation-record.json","paper":"/paper/2605.24956"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"Gqa: Training generalized multi-query transformer models from multi-head check- points.arXiv preprint arXiv:2305.13245,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:845b5964b0337f9049a3c6b9fd863bf129ca68edf87184c0351269c583cb7787","observation_id":"f872ea8d-66a4-4c18-858f-a13568cdc3d2","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-07-06T20:12:54.710203Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18619","snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"Next token predic- tion towards multimodal intelligence: A comprehensive survey.arXiv preprint arXiv:2412.18619,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"cited_paper":"/paper/2412.18619","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:3fe862b1c20c848370d39df10b8222c36aec7add853f397ae4eab5c1779ba80a","observation_id":"1c3ab298-d7ac-4ac3-b52e-158f88d19a75","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:536a0472d4370e0918432127cc156e4215d123c012c5d094edc23c84e6caa483","observation_id":"284b326c-502b-4174-ab73-84a170a6ca51","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:b3ccd7634fcd12bc8bd3c6aa69a826d5c62951dbfe10f126078a5b71ac7a73a0","observation_id":"45c18772-fa57-40d2-b270-10e9b8b39c34","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.00512","last_updated":"2019-09-02T01:51:46Z","snapshot_observed_at":"2026-07-06T08:18:18.838990Z","submitted_at":"2019-09-02T01:51:46Z","title":"How Contextual are Contextualized Word Representations? Comparing the Geometry of BERT, ELMo, and GPT-2 Embeddings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.00512","snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"How contextual are contextualized word representations? comparing the geometry of bert, elmo, and gpt-2 embeddings.arXiv preprint arXiv:1909.00512,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"cited_paper":"/paper/1909.00512","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:24cd7eefa65dfaf7f2d9b26cdf55f0cfa6e2a2e085f957869381c8d80b91264c","observation_id":"45296ac4-6d8c-4cf3-a99d-4716d05b9dfa","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.12009","last_updated":"2019-07-28T03:57:41Z","snapshot_observed_at":"2026-07-06T08:10:42.792778Z","submitted_at":"2019-07-28T03:57:41Z","title":"Representation Degeneration Problem in Training Natural Language Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.12009","snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"Representation degeneration problem in train- ing natural language generation models.arXiv preprint arXiv:1907.12009,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"cited_paper":"/paper/1907.12009","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:331807920db3f7822635b7f98e3726c6eaf0fff3e94afabbf91ee6d2f43f81d1","observation_id":"fe23d654-343f-4ae3-83cb-cb1bc98aa189","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"The pile: An 800gb dataset of diverse text for language modeling.arXiv preprint arXiv:2101.00027,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:5a14e3dcb53f961fe1ba103c0d0fd60a7be4efad32efb7d04f5e2c8e87e9dea7","observation_id":"bedc496f-98f8-4828-a1bb-346767839919","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19737","last_updated":"2024-04-30T17:33:57Z","snapshot_observed_at":"2026-08-03T23:22:09.849239Z","submitted_at":"2024-04-30T17:33:57Z","title":"Better & Faster Large Language Models via Multi-token Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19737","snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"Y ., Rozi`ere, B., Lopez-Paz, D., and Synnaeve, G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"cited_paper":"/paper/2404.19737","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:c2eca5a70b5d40e37260c03fff21706c22c69d8f52e3440a2a185bce5a8f8ecb","observation_id":"fee8a5db-d6e9-4976-98eb-aa11357ca289","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"Minillm: Knowl- edge distillation of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:49fae5c43b657dfd364f75f76f48fcef7ce4475412d5c0b1f67e21895a9e86c5","observation_id":"fb9c5d06-ff17-4927-bb5f-b367f5d17433","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"Measuring mas- sive multitask language understanding.arXiv preprint arXiv:2009.03300,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:d277760b3ad42503e065c2d395a505aa46f3d5dd3f2ac62710eabf8f7a5075ab","observation_id":"20f24f6c-ba20-4f29-8194-7b684153a2dd","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:33e9676cee3600cc887543842ad0a04508816a4ea04c7a93cd218f684103a047","observation_id":"8c5556cf-97e5-4241-9fc3-5ca019c6b71f","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"Tinybert: Distilling bert for natural language understanding","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:27be38b4a813f408a3f7ad8bdde03ac065ad0818b9d8d69ff364900d3a6fcbf8","observation_id":"b98441cd-c429-4287-9f12-a99ff671c262","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., and Amodei, D","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:dd1d1085f3651062223827324364fd1794bfdd1c3e220a80b8c4bfcb1cc6e2c8","observation_id":"3b779c04-d0ac-48bf-bc8f-10e2a7ecb00a","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00225","last_updated":"2019-11-01T06:48:07Z","snapshot_observed_at":"2026-08-02T07:37:21.288457Z","submitted_at":"2019-11-01T06:48:07Z","title":"When Choosing Plausible Alternatives, Clever Hans can be Clever","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.00225","snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"When choosing plausible al- ternatives, clever hans can be clever.arXiv preprint arXiv:1911.00225,","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"cited_paper":"/paper/1911.00225","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:e942ca3d6edaf5c163a9271184fea6c32fef013b9e91d107863e0d4b3350a2d1","observation_id":"23deae2c-26ff-444a-8d49-9ba1b3fce52b","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02871","last_updated":"2023-06-09T08:57:07Z","snapshot_observed_at":"2026-07-06T14:00:22.500463Z","submitted_at":"2022-09-30T02:25:12Z","title":"Self-Distillation for Further Pre-training of Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02871","snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"J., and Kawaguchi, K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"cited_paper":"/paper/2210.02871","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:e54bbe1460c7ad09258317c966b7af051a8d93c7a4651b66f9922666b005ed7d","observation_id":"3099c140-0127-490d-8ac2-4375c0ded92b","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model.arXiv preprint arXiv:2405.04434, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:76608429f5949d3de0f793b72f23d0aa3e8f5f27dbff2cab8dd498d03a830baf","observation_id":"4e076dbe-51b2-468d-9bd7-c5cea22c1e0a","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01509","last_updated":"2024-06-09T13:07:50Z","snapshot_observed_at":"2026-08-02T03:54:54.655157Z","submitted_at":"2024-03-03T13:14:47Z","title":"Fantastic Semantics and Where to Find Them: Investigating Which Layers of Generative LLMs Reflect Lexical Semantics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01509","snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"Fantastic semantics and where to find them: Investigating which layers of generative llms reflect lexical semantics.arXiv preprint arXiv:2403.01509, 2024c","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"cited_paper":"/paper/2403.01509","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:e48445b902b2cce985c3a1ffa603f8cf48bc1f7f982f16f20a99f633d9d67ed1","observation_id":"e08aa440-a3fe-4438-93b4-fc33196a1850","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:8890c07fdbb1c17eed275c459a9feb985e879579b0a496f4fc73f355e10d8e05","observation_id":"bad0bc0a-3a26-41f8-b3fa-c9e66bb9b2ce","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"Mteb: Massive text embedding benchmark","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:81af735fdb344d816e39953db22d4e9da17821facae29aacde25fb6e25b86049","observation_id":"2099a6f5-6b24-4663-bab6-e0f1aa5c9ee5","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:303c7f784a5641169b8b3531609a75f05c66d104c50316460677e8e96d09bc5b","observation_id":"8ab55965-31d0-4884-9c49-0a38bbd37a0e","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04897","last_updated":"2023-11-08T18:56:35Z","snapshot_observed_at":"2026-07-06T16:44:51.557703Z","submitted_at":"2023-11-08T18:56:35Z","title":"Future Lens: Anticipating Subsequent Tokens from a Single Hidden State","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04897","snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"C., and Bau, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"cited_paper":"/paper/2311.04897","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:4489c36015d704a707045886b54d51eb1934089fc4ac932dded0a785dc25544b","observation_id":"4e1aa5cd-9562-4bbb-ac68-0669e7eb8dde","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6550","last_updated":"2015-03-27T11:52:28Z","snapshot_observed_at":"2026-07-06T04:04:16.777653Z","submitted_at":"2014-12-19T22:40:51Z","title":"FitNets: Hints for Thin Deep Nets","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6550","snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"E., Chassang, A., Gatta, C., and Bengio, Y","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"cited_paper":"/paper/1412.6550","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:ace04edee0028ffb836effe2f7f1a4439d05e77ee77bb5a1ad2cf4c5dd242e7b","observation_id":"bd5c26b7-6ce6-4f8e-b151-da3a192d7300","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.11851","last_updated":"2025-07-16T02:31:40Z","snapshot_observed_at":"2026-08-03T19:29:19.461164Z","submitted_at":"2025-07-16T02:31:40Z","title":"Your LLM Knows the Future: Uncovering Its Multi-Token Prediction Potential","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.11851","snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"Your llm knows the future: Uncovering its multi-token prediction potential.arXiv preprint arXiv:2507.11851,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"cited_paper":"/paper/2507.11851","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:85fde54ef686fcdd022e05af55474bfed0319cbd9f185347f95b4a4b14389e0e","observation_id":"e912ef23-9fff-4880-a03c-c67b89d2f48e","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"Glu variants improve transformer.arXiv preprint arXiv:2002.05202,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:9d180578c272ad9548420b9c1b5889b38acccdd6f9ef980df59e2e310e97d66a","observation_id":"abf7d550-48e4-43ae-9c88-02639a54e9e0","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:b80b5f4dd064e4b7d0c563c82de4e8cbdd9200a1f20eb98432eb4d97dcedbcc0","observation_id":"0a267b32-6956-43bc-af60-19367af57619","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02013","last_updated":"2025-06-15T18:27:17Z","snapshot_observed_at":"2026-08-01T16:50:50.645857Z","submitted_at":"2025-02-04T05:03:42Z","title":"Layer by Layer: Uncovering Hidden Representations in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02013","snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"R., Zhao, D., Patel, N., Naghiyev, J., LeCun, Y ., and Shwartz-Ziv, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"cited_paper":"/paper/2502.02013","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:2a6c928283cb2c67a511bc8b62a4408f0fdf28c8b10c8a5994241d0dabb154ad","observation_id":"25fbb8c4-dd70-4ea6-a349-250c75b9e57b","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09355","last_updated":"2019-08-25T16:13:24Z","snapshot_observed_at":"2026-07-06T08:16:39.915426Z","submitted_at":"2019-08-25T16:13:24Z","title":"Patient Knowledge Distillation for BERT Model Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.09355","snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"Investigating prior knowledge for challenging chinese machine reading com- prehension.Transactions of the Association for Compu- tational Linguistics, 8:141–155, 2020a","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"cited_paper":"/paper/1908.09355","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:15a3322554e82f29f453ededf10beacbdab08617074d71aab04c85ec86db0a2d","observation_id":"d7be940a-e20c-4407-add2-74746e405e6a","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"Contrastive distillation on intermediate representations for language model compression","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:9bad149812762c25ecb69f5be2ab78de0a850bbdf6814981b7568e17dc8ea36e","observation_id":"6867df25-a06b-4523-b272-5c9f14dc8d43","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-07-06T20:35:26.547905Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08524","snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"Llm pretraining with continuous concepts.arXiv preprint arXiv:2502.08524,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"cited_paper":"/paper/2502.08524","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:26d25b22e53a560622fcfa0171b4312351bfd6ff07d20688f8eeda93d6311a6b","observation_id":"80db826e-7060-4cb0-b06e-9e99428f908b","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"Com- monsenseqa: A question answering challenge targeting commonsense knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:d371c8ffbfaedc31f4b61d1876af07e314ee270a0052bdc5779b3821a85fb437","observation_id":"2bd389a7-40bc-461f-893c-3f7aa8870495","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"Kimi k2: Open agentic intelligence.arXiv preprint arXiv:2507.20534,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:d38e7eeece538cf151b7066ffe82840805abde8ac1f01f8be627aff85dadf59c","observation_id":"d8b4d4d1-d6fc-4534-b532-4fab4cef1492","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05192","last_updated":"2024-12-02T21:54:54Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T16:49:39Z","title":"Understanding Warmup-Stable-Decay Learning Rates: A River Valley Loss Landscape Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05192","snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"Understanding warmup-stable-decay learning rates: A river valley loss landscape perspective.arXiv preprint arXiv:2410.05192,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"cited_paper":"/paper/2410.05192","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:d4e473d47e17352c3dce6d6513b1499f1340183e7205255576a460aef4b2b50f","observation_id":"a1f1d358-8aa6-49fa-8bdb-b54f577e9629","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06694","last_updated":"2024-04-11T01:18:06Z","snapshot_observed_at":"2026-08-02T10:03:27.228650Z","submitted_at":"2023-10-10T15:13:30Z","title":"Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06694","snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"Sheared llama: Accelerating language model pre-training via structured pruning.arXiv preprint arXiv:2310.06694,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"cited_paper":"/paper/2310.06694","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:6b7b24e3df9b82762b2e03c74896feaa04b4a41906c29b3060dae39a29d9e99a","observation_id":"9badcd3a-81d1-49f7-9aa3-0f92107f0e51","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:140625b3b8abf60beaf5a5f03493b733df3df5cd69c5b810324f2298a6c8e9b8","observation_id":"1d4a81b6-8d2c-4bee-b12b-acec38b0ce69","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model?arXiv preprint arXiv:2504.13837,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:cf16dfaf7cce499965650554c05210be704fb1be83dfbaf3504fa216f17d642d","observation_id":"5bf1e222-ee6d-4a1a-8ed2-0a47cad18eef","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05176","last_updated":"2025-06-11T02:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-05T15:49:48Z","title":"Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05176","snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"Qwen3 embed- ding: Advancing text embedding and reranking through foundation models.arXiv preprint arXiv:2506.05176,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"cited_paper":"/paper/2506.05176","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:61127ff3db3fd813beb69ee9942077f53d50a5f3cfe1c0e7d4c173a78ac38d5a","observation_id":"b4e6b3dd-02c7-4bc0-9151-b766bc10cc32","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"Repre- sentation degeneration problem in prompt-based models for natural language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:83ec95ade8888a2ebfa5b40b39f364da934ef070a6f570e8315c2bf29464e546","observation_id":"544d1b85-a7b1-43dd-a17b-48903d3d0421","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"Agieval: A human- centric benchmark for evaluating foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:7cf5922997da5e56b220797837faf93188b3cf4edaa43af40b025fc40bacac84","observation_id":"912ffb0b-1a9b-40b0-802e-9bbb1c9cf8e9","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"M., Fuadi, E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:258041d91fd284b189f5e646ac55aa17b22d18c768af00e89f4d540090715d48","observation_id":"152b2086-2de2-4e05-925e-69cfe7c30b62","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"The learning rate and global batch size are scaled according to model size, while the context length is fixed to 8192 tokens for all experiments","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:757b0071c8b8a1331e727c249e5b20635c7fea5479b315e7545ca3d192fcf6c7","observation_id":"7cbb8c04-2c59-45aa-b79b-526ed788c2ff","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"2.006 (PPL 7.43 vs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:8374672cdedc69b25d9f81c6e6c962777f78ccb3ed1d29dacbbdedf263663b0d","observation_id":"77a4a9a2-93e2-448e-b89f-02ed21f891e3","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-16T23:18:43.955530Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2605.24956."}