{"as_of":"2026-08-10T15:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ecd9d9141d8fc82bcd5ad3b452dab820488eca03bc2c0d82932d484f01cce953","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T13:46:43.619470Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T08:50:43.217179Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02007","snapshot_observed_at":"2026-08-01T08:50:43.217179Z","title":"arXiv preprint arXiv:2502.02007 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21005","last_updated":"2026-07-23T07:39:03Z","snapshot_observed_at":"2026-08-06T16:38:33.932762Z","submitted_at":"2026-07-23T07:39:03Z","title":"Weight-norm Criticality: A Mechanism for Loss Spikes Induced by the Normalization and Weight Decay","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-01T08:50:43.217179Z"},"links":{"cited_paper":"/paper/2502.02007","citing_paper":"/paper/2607.21005"},"observation_digest":"sha256:04942dbe630839aa170104b13d305a490a1e88c3276e20b0d77c5e756b7f7d39","observation_id":"291098ac-6303-4e3b-9c1c-f6473047bec8","resolution":{"observed_at":"2026-08-01T08:50:43.217179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.02007/citation-record","integrity":"/paper/2502.02007/integrity","json":"/paper/2502.02007/citation-record.json","paper":"/paper/2502.02007"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.08905","last_updated":"2024-12-12T03:37:41Z","snapshot_observed_at":"2026-08-05T04:04:21.846023Z","submitted_at":"2024-12-12T03:37:41Z","title":"Phi-4 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08905","snapshot_observed_at":"2026-08-09T13:46:43.282422Z","title":"J., Javaheripi, M., Kauffmann, P., Lee, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.282422Z"},"links":{"cited_paper":"/paper/2412.08905","citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:4be4366a8890ff951f002cc3dbf6054faa5369f5d6f3c91528d0a745f9b2dc45","observation_id":"908f4876-0b39-4468-b68b-25e6da6230ad","resolution":{"observed_at":"2026-08-09T13:46:43.282422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:44.813992Z","title":"and Nagarajan, V","venue":null,"work_id":"075310c3-edc8-4d29-9a5c-23f2d0be511b","year":2024},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.288710Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:007a9f615a62ffa829bd0882ea713f4660d3fbd22aa33c377b192dfdcbf2280a","observation_id":"0bc3db89-9f45-4529-a4eb-512b5c8a79a6","resolution":{"observed_at":"2026-08-09T13:46:44.818716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:44.797831Z","title":"and Giryes, R","venue":null,"work_id":"3243a261-d1a6-4779-94c7-050f9e38eeee","year":2020},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.294502Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:c6583473c2a7947c87e92d1c0dd1efb017d12a7caca0e7c5c9545293d2ad4ba6","observation_id":"5a091145-20fd-4987-a9f7-37a6a77efe5d","resolution":{"observed_at":"2026-08-09T13:46:44.803082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.14000","last_updated":"2025-04-17T11:11:51Z","snapshot_observed_at":"2026-07-06T13:36:18.367204Z","submitted_at":"2022-07-28T10:44:46Z","title":"Multi-Step Deductive Reasoning Over Natural Language: An Empirical Study on Out-of-Distribution Generalisation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.14000","snapshot_observed_at":"2026-08-09T13:46:43.299577Z","title":"Y., Hartill, T., Tan, N., Deng, Z., Witbrock, M., and Liu, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.299577Z"},"links":{"cited_paper":"/paper/2207.14000","citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:2b3d39f74032cbaaf347b6cdb16b3ddb6c1420a6375ccd5d5048392d37c293bc","observation_id":"54745b23-35fb-4dec-9396-4dc895cbfc58","resolution":{"observed_at":"2026-08-09T13:46:43.299577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:44.781361Z","title":"Understanding robustness of transformers for image classification","venue":null,"work_id":"d9e858c7-fe83-482d-9b63-0f2fd2f95617","year":2021},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.305137Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:1e4fa0b45bad5db49145f8c9c333d50606b21a1cd48073d2b726d1797239474c","observation_id":"b0fb012e-f872-44c1-b650-21a26278852c","resolution":{"observed_at":"2026-08-09T13:46:44.786239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:43.310512Z","title":"R., Angeli, G., Potts, C., and Manning, C","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.310512Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:e4f2c4dce83d824ad86601985b453cb49d4be4ea24d6c8b174cb1c85fd5d5c49","observation_id":"b1e68e2b-b26c-43cb-b507-2af169b07173","resolution":{"observed_at":"2026-08-09T13:46:43.310512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-09T13:46:43.316250Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.316250Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:0038a7c5f727779ea9d04376bfe5e77d7f5f54cd07c6182c9b536a4d1da6727c","observation_id":"64acb6d5-312d-4437-a06c-2ecbe4500664","resolution":{"observed_at":"2026-08-09T13:46:43.316250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:44.765009Z","title":"Dropout as a low-rank regularizer for matrix factorization","venue":null,"work_id":"374c5f0d-288b-4a9f-9c15-bfe021d9b604","year":2018},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.321652Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:72ca7bb5a933c858bb177bd68bde4cf865a71d510224a026172f655e04ad3ca0","observation_id":"26d82bc1-9b13-477a-b139-85f4720360ab","resolution":{"observed_at":"2026-08-09T13:46:44.770532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:43.326651Z","title":"Transformers as soft reasoners over language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.326651Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:47f1a05ea5c8f3a6392bfe400892e1fe96e06dedcb62363f9519b67b4414c296","observation_id":"72c42146-f7ca-464b-8eeb-13a91c8e4e1c","resolution":{"observed_at":"2026-08-09T13:46:43.326651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14838","last_updated":"2024-05-23T17:54:14Z","snapshot_observed_at":"2026-07-06T18:18:51.814306Z","submitted_at":"2024-05-23T17:54:14Z","title":"From Explicit CoT to Implicit CoT: Learning to Internalize CoT Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14838","snapshot_observed_at":"2026-08-09T13:46:43.331535Z","title":"From explicit cot to implicit cot: Learning to internalize cot step by step, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.331535Z"},"links":{"cited_paper":"/paper/2405.14838","citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:fbaacb006de9a378a58ad12562631aaa6a2ac8312b9d7b12bb3b39b98b710118","observation_id":"e1d7fe60-f30a-416f-a531-3f5520c0b2ca","resolution":{"observed_at":"2026-08-09T13:46:43.331535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11556","last_updated":"2019-09-25T15:35:03Z","snapshot_observed_at":"2026-08-08T18:02:18.011077Z","submitted_at":"2019-09-25T15:35:03Z","title":"Reducing Transformer Depth on Demand with Structured Dropout","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11556","snapshot_observed_at":"2026-08-09T13:46:43.336880Z","title":"Reducing transformer depth on demand with structured dropout, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.336880Z"},"links":{"cited_paper":"/paper/1909.11556","citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:826fd04b468a3cc06939e0f259fa53ce54f09c8e88f0d7c67210e11f8cd96025","observation_id":"ec8fa746-963f-4ee2-a080-7addc029617f","resolution":{"observed_at":"2026-08-09T13:46:43.336880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:44.749454Z","title":"and Tu, Y","venue":null,"work_id":"44a9265f-135e-4a81-a75a-ebdb72118490","year":2021},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.342409Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:32b90584ed2cc39e4c364faadcad300b2de6e12130ba0a1c8d245d132cd9bc6e","observation_id":"b3ed6204-64b0-475a-99a1-9b58e512403f","resolution":{"observed_at":"2026-08-09T13:46:44.754241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:44.734458Z","title":"Y., Roziere, B., Lopez-Paz, D., and Synnaeve, G","venue":null,"work_id":"02a6a9dd-b41e-4e2e-9d99-14a299ee83bb","year":2024},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.347125Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:202f87b05645d8f2ce920b2483c87876a787448f5684ae789b7607349b474f57","observation_id":"004c79a9-e648-4a5a-9026-951e34de47d9","resolution":{"observed_at":"2026-08-09T13:46:44.739085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06769","last_updated":"2025-11-03T00:53:34Z","snapshot_observed_at":"2026-08-07T06:05:27.895209Z","submitted_at":"2024-12-09T18:55:56Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06769","snapshot_observed_at":"2026-08-09T13:46:43.351846Z","title":"Training large language models to reason in a continuous latent space, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.351846Z"},"links":{"cited_paper":"/paper/2412.06769","citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:3fcc0b406836fe445704aff1eda11b5f68405822ba0cb47578fef4734b8932ed","observation_id":"dcf418dc-aec7-462a-a395-17c6feb2b8d6","resolution":{"observed_at":"2026-08-09T13:46:43.351846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13442","last_updated":"2025-08-31T18:53:24Z","snapshot_observed_at":"2026-08-10T07:07:01.574542Z","submitted_at":"2024-08-24T02:48:40Z","title":"A Law of Next-Token Prediction in Large Language Models","version":3},"cited_work":{"arxiv_id":"2408.13442","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.13442","snapshot_observed_at":"2026-08-09T13:46:44.301195Z","title":"A Law of Next-Token Prediction in Large Language Models","venue":"cs.LG","work_id":"4d0fb098-62a2-455a-b6df-ef48375bb91f","year":2024},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.357172Z"},"links":{"cited_paper":"/paper/2408.13442","citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:732f7df2aa8d3ea9adfd9042431430b2427c10d311983b200a3ad7fd800c5410","observation_id":"0373d6dc-8f9b-411e-b6a5-e400175c010a","resolution":{"observed_at":"2026-08-09T13:46:44.306519Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15786","last_updated":"2024-10-17T02:43:35Z","snapshot_observed_at":"2026-08-03T10:43:35.890260Z","submitted_at":"2024-06-22T08:41:48Z","title":"What Matters in Transformers? Not All Attention is Needed","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15786","snapshot_observed_at":"2026-08-09T13:46:43.362438Z","title":"What matters in transformers? not all attention is needed, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.362438Z"},"links":{"cited_paper":"/paper/2406.15786","citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:4ae90f32ab325b43a49796e57d6b3a25ac725e58f68bda024650c402ec257f4a","observation_id":"5889224b-91c3-4f62-977f-ef673b0eab86","resolution":{"observed_at":"2026-08-09T13:46:43.362438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:43.367522Z","title":"Pretrained transformers improve out-of-distribution robustness","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.367522Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:993ff5a6d806b0b4a908529cc4491e3fce52fc12a91692dff37fd8a6986d2812","observation_id":"42335d35-d8bc-4683-8f70-55e86a492a40","resolution":{"observed_at":"2026-08-09T13:46:43.367522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:44.719543Z","title":"and Schmidhuber, J","venue":null,"work_id":"155f4374-758d-4913-bfcd-dc29761a43f2","year":1997},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.372397Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:22a8b8c655bcca7ac24e235f906f14afcb42d655ead93427d7ccd7983f2f9ec6","observation_id":"80767613-99e7-4bfa-9773-0c646eae34da","resolution":{"observed_at":"2026-08-09T13:46:44.724058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05914","last_updated":"2023-10-10T17:31:00Z","snapshot_observed_at":"2026-08-10T07:07:00.726494Z","submitted_at":"2023-10-09T17:58:34Z","title":"NEFTune: Noisy Embeddings Improve Instruction Finetuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05914","snapshot_observed_at":"2026-08-09T13:46:43.378061Z","title":"R., Kailkhura, B., Schwarzschild, A., Saha, A., Goldblum, M., Geiping, J., and Goldstein, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.378061Z"},"links":{"cited_paper":"/paper/2310.05914","citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:388ccb1fe5ccad778c71573efec21faab16db825b53296d5a3f6c6e2362549e4","observation_id":"d3608fce-dd3f-4a81-94ca-1d129db31b3e","resolution":{"observed_at":"2026-08-09T13:46:43.378061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:43.383548Z","title":"S., Mudigere, D., Nocedal, J., Smelyanskiy, M., and Tang, P","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.383548Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:bcdcf923fc3e726c97c2cbf1fe865ebce9130bb458599e71fef63465b0757cd9","observation_id":"fdeedeed-ec45-46a3-90c1-5753574ac00b","resolution":{"observed_at":"2026-08-09T13:46:43.383548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:44.692921Z","title":"N., Hellmann, S., Morsey, M., Van Kleef, P., Auer, S., et al","venue":null,"work_id":"6cd3a88d-06d2-419c-9853-355f4ba092e6","year":2015},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.388908Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:8b8f4a6e7645d002e94947bf7b05b625e4cef7b083b28a7d39b14bbf6ce14ebf","observation_id":"d34e9dcb-e86e-48a9-8da7-8b7bdf6dbfce","resolution":{"observed_at":"2026-08-09T13:46:44.697997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:44.676969Z","title":"J., Xing, E., and Caruana, R","venue":null,"work_id":"c0d85cc5-31b2-41c7-a17d-1c520032e204","year":2022},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.393776Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:02bd421feaa94ee8bd8e54dcabfddd7ec7a86b2913ffe0a39871d7310f78b137","observation_id":"a0bf94c7-c237-48c6-9fb2-05d1b59d2d50","resolution":{"observed_at":"2026-08-09T13:46:44.681991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.02646","last_updated":"2023-04-11T07:35:33Z","snapshot_observed_at":"2026-08-10T07:07:12.957600Z","submitted_at":"2022-08-04T13:24:04Z","title":"DropKey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.02646","snapshot_observed_at":"2026-08-09T13:46:43.398762Z","title":"Dropkey, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.398762Z"},"links":{"cited_paper":"/paper/2208.02646","citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:c5638e09841215c5034217fbc28fcf997bf4f0375c4732f9623876749d806c6e","observation_id":"599dc58c-32e0-4abc-9f01-e43c660afdad","resolution":{"observed_at":"2026-08-09T13:46:43.398762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-acl.485","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Challenging large language models with new tasks: A study on their adaptability and robustness","venue":null,"work_id":"c908e4fa-593a-4996-bcd7-5c3d762cae62","year":2024},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.403768Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:8489cfa14d8e5d01c05151344e12d8183867719642bf4d2d159fa138a8bf8fc9","observation_id":"045c0bc8-f000-49af-bbff-6e95ce11acf6","resolution":{"observed_at":"2026-08-09T13:46:43.800168Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:44.659814Z","title":"Visualizing the loss landscape of neural nets","venue":null,"work_id":"60b77c14-a5d7-49ed-ac26-0c2610b85cf4","year":2018},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.408608Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:ee555b905de8bb5e9d8fb57efc90657847f23742cb7706485fa8b5fa7dca0397","observation_id":"ce9ae42e-ea01-4df8-91f7-653a262e3cbd","resolution":{"observed_at":"2026-08-09T13:46:44.665175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:44.643153Z","title":"E., Singh Rawat, A., and Oymak, S","venue":null,"work_id":"bf74e6f8-328f-441c-9969-78370e20daac","year":2024},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.413206Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:52a1fedf126ce3bac4a647390bff211885880a05b58b45bb7f0168ac1f69bb8f","observation_id":"71f357b0-9897-4fb4-9bc3-24524f166e75","resolution":{"observed_at":"2026-08-09T13:46:44.648043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07965","last_updated":"2025-01-08T09:07:54Z","snapshot_observed_at":"2026-08-10T07:06:40.041118Z","submitted_at":"2024-04-11T17:52:01Z","title":"Rho-1: Not All Tokens Are What You Need","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07965","snapshot_observed_at":"2026-08-09T13:46:43.418162Z","title":"Rho-1: Not all tokens are what you need, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.418162Z"},"links":{"cited_paper":"/paper/2404.07965","citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:b078077de0180cc561491cda1e3e2d38736ec7a697d43cd212a5cc598b505f45","observation_id":"638fbb91-2244-4cfb-bbf0-bd7c71d5aa05","resolution":{"observed_at":"2026-08-09T13:46:43.418162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:44.627489Z","title":"M., Li, Z., and Ma, T","venue":null,"work_id":"e4044e4d-7557-478a-a1ac-d2a40855af8d","year":2023},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.423209Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:28e2f2eb72d51cea59d4d80ebfdbf41498b3f30a9f11e5e245c991df70f0abf8","observation_id":"bb035bc5-c676-4945-be4e-7ed6c8263df2","resolution":{"observed_at":"2026-08-09T13:46:44.632706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:44.612192Z","title":"and Ying, L","venue":null,"work_id":"baad24b9-5939-4e73-bec1-5ad7d2391455","year":2021},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.428213Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:f043cca397bc3e9b0a294c4b53859752fdc6760a4e9e80b6b731a65c9e7ad067","observation_id":"405bb9c5-4ebb-4351-829a-b8ec1772e82f","resolution":{"observed_at":"2026-08-09T13:46:44.616824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:43.433208Z","title":"Next-token prediction capacity: general upper bounds and a lower bound for transformers, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.433208Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:8c4c1b56c64f78fb962bc87bf2eef7d325a1a42bf23166476d9ff7dae5975931","observation_id":"2ea55aa7-4095-49a2-8ac6-d49fba158f4d","resolution":{"observed_at":"2026-08-09T13:46:43.433208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:44.596376Z","title":"On the implicit bias of dropout","venue":null,"work_id":"3e69c5f7-ec95-441c-86e3-e7ee8579f24a","year":2018},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.438140Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:d3481dd8ca5d1616a6f9eb572eb5d1fb34c59432b92d0d8c740c8e39f3f9a86b","observation_id":"3f18b2ec-3d31-4193-9860-5a52fe1ae1bb","resolution":{"observed_at":"2026-08-09T13:46:44.601307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07663","last_updated":"2022-10-14T09:30:36Z","snapshot_observed_at":"2026-08-10T07:07:03.959314Z","submitted_at":"2022-10-14T09:30:36Z","title":"Pretrained Transformers Do not Always Improve Robustness","version":1},"cited_work":{"arxiv_id":"2210.07663","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.07663","snapshot_observed_at":"2026-08-09T13:46:44.121748Z","title":"Pretrained Transformers Do not Always Improve Robustness","venue":"cs.CL","work_id":"53c21c4e-a878-411c-8a40-20524ec62805","year":2022},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.443060Z"},"links":{"cited_paper":"/paper/2210.07663","citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:fd40117fae40d4f93161757515102b0223322d59ff7ad988da6082133c533fd2","observation_id":"53d00bd4-9b33-4657-b951-5a431f8cafe1","resolution":{"observed_at":"2026-08-09T13:46:44.127239Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.emnlp-main.117","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"and Samwald, M","venue":"Proceedings of the 2021 Conference on Empirical Methods in Natural Language Processing","work_id":"249e29d5-6fa5-4b17-aa1a-260a8f443ab0","year":2021},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.448286Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:94b60a57d8b74f283dc34d0c22d7a5afd2d1f28ecd22a616cc6741af7bf986eb","observation_id":"128a33fd-553f-42f0-a89e-e447c3a3bb11","resolution":{"observed_at":"2026-08-09T13:46:43.783504Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.09557","last_updated":"2022-01-29T14:48:50Z","snapshot_observed_at":"2026-08-10T11:01:19.200508Z","submitted_at":"2021-05-20T07:25:07Z","title":"Power-law escape rate of SGD","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.09557","snapshot_observed_at":"2026-08-09T13:46:43.453263Z","title":"Power-law escape rate of sgd","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.453263Z"},"links":{"cited_paper":"/paper/2105.09557","citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:350285e9143989b3433e939d3696b56128fb43a8074e100cfe8a233b0d0411d6","observation_id":"79db3ce0-125d-490e-9828-df83de123781","resolution":{"observed_at":"2026-08-09T13:46:43.453263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15099","last_updated":"2022-04-11T13:43:04Z","snapshot_observed_at":"2026-08-10T08:29:52.523235Z","submitted_at":"2022-03-28T21:13:22Z","title":"LogicInference: A New Dataset for Teaching Logical Inference to seq2seq Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15099","snapshot_observed_at":"2026-08-09T13:46:43.459652Z","title":"Logicinference: A new dataset for teaching logical inference to seq2seq models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.459652Z"},"links":{"cited_paper":"/paper/2203.15099","citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:9259bc88320dc9586e4d76009fe114045366800c2f8a209c7376d3525fa98d69","observation_id":"36c2b9ac-3e90-46a9-8e47-10777162b5a6","resolution":{"observed_at":"2026-08-09T13:46:43.459652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:44.578923Z","title":"and Narasimhan, K","venue":null,"work_id":"48627e5c-4293-4586-b1e3-e2c15b32e384","year":2018},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.464879Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:42904e5b4a232e1289cf1797d0a4fecdfb6b51461ea70901adbd210f254eecd7","observation_id":"991996d3-8a7c-4857-b014-46ed8f8781cc","resolution":{"observed_at":"2026-08-09T13:46:44.584285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:43.469944Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.469944Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:55e15ff514da4e144594ac4e4da256e2ee4449c43fbf1f4b735a555a801a45d7","observation_id":"7cbfafc1-b7aa-4038-b36f-4521b0666e6d","resolution":{"observed_at":"2026-08-09T13:46:43.469944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:43.474845Z","title":"R obust LR : A diagnostic benchmark for evaluating logical robustness of deductive reasoners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.474845Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:d32a221fb863d0369c00eac11dc3aaa9677e11d99cf9e3821c6693ece996847a","observation_id":"d24bcdc6-d40d-449b-b2bd-fdd6d1898055","resolution":{"observed_at":"2026-08-09T13:46:43.474845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:43.479930Z","title":"and He, H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.479930Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:fb2544c9a3e1ccdbbce33713800edacb6681fa23fec54bc6f57cdd7d9f107f12","observation_id":"1242e8b6-90c7-41f1-a5a8-e94f5255b8ed","resolution":{"observed_at":"2026-08-09T13:46:43.479930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:43.485090Z","title":"Stepgame: A new benchmark for robust multi-hop spatial reasoning in texts","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.485090Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:a39a3081e32b9189858472e4610f79605959fe7a385a8b72f089b7b4a53f2d5d","observation_id":"e0def47a-ad1f-4840-9711-164b47e0c829","resolution":{"observed_at":"2026-08-09T13:46:43.485090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:43.490010Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.490010Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:968110c22d0ad600964ef00f5bdb8e74d80d7fb90d267a7925cd7832ec16ff41","observation_id":"03ca9248-61bf-40b2-8d41-56918fad7417","resolution":{"observed_at":"2026-08-09T13:46:43.490010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:43.495140Z","title":"P roof W riter: Generating implications, proofs, and abductive statements over natural language","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.495140Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:842553f7b287ee9ba97631f84b497a448456fdd6265223d2c660d3ab29eb55d2","observation_id":"50ab1b23-a4ab-427b-86b2-c90363ac2245","resolution":{"observed_at":"2026-08-09T13:46:43.495140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:43.500250Z","title":"Memorisation versus generalisation in pre-trained language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.500250Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:da67b86ecb7dcf660b38b9bf1700d391a9ec08ec3ba18166510661fa14181e1c","observation_id":"2d6c2844-7d4b-412d-b39f-f2f929cb2d8d","resolution":{"observed_at":"2026-08-09T13:46:43.500250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:44.541328Z","title":"Implicit optimization bias of next-token prediction in linear models","venue":null,"work_id":"881ebb85-2959-442f-97ee-b85ed5dfbbcf","year":2024},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.505179Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:c0ff31edafa36cf4eaee06665fdeaf18a9756fad5b43069338583523fcb6eadc","observation_id":"4d0b59b2-752d-417e-a8e7-4396418c8023","resolution":{"observed_at":"2026-08-09T13:46:44.547038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1162/tacl_a_00335","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"An empirical study on robustness to spurious correlations using pre-trained language models","venue":"Transactions of the Association for Computational Linguistics","work_id":"fe7fe800-ed27-4801-8bd0-fa2030c1eb9e","year":2020},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.509922Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:25680a0fb7ba66e670ccbbc56ad2bc5c2bb6fd8978b02dc47e50d3b3b874fa02","observation_id":"9104245d-a585-445a-9e04-f9e73cdc3f99","resolution":{"observed_at":"2026-08-09T13:46:43.713990Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:43.514920Z","title":"L ogic A sker: Evaluating and improving the logical reasoning ability of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.514920Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:737f0a095dd589d67c99d086ee797b61639b898f1ea89dcf3dd268bc24f5767d","observation_id":"4d3139d1-8c38-47b7-a762-b88b682e82df","resolution":{"observed_at":"2026-08-09T13:46:43.514920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:44.524479Z","title":"Are large language models really robust to word-level perturbations? In Socially Responsible Language Modelling Research, 2023","venue":null,"work_id":"982b4d38-89d9-4ae9-ae1c-0005453e5adf","year":2023},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.519722Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:36bcdb23de2d35366601db5ef57b0ebeb5ebf0229fec0d6583e3dbcf0fce4c7f","observation_id":"9d3daf19-287c-4f20-aa3b-8b685bcc4b2b","resolution":{"observed_at":"2026-08-09T13:46:44.529595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:44.507932Z","title":"The implicit and explicit regularization effects of dropout","venue":null,"work_id":"ce7dedf1-8a91-4567-a983-9fe7bd959412","year":2020},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.524447Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:486dad4fcf41613f490e00346c08af2948574c1e67c166b9109207264aff6603","observation_id":"cc99b161-f150-445d-a9f1-c18593e4f879","resolution":{"observed_at":"2026-08-09T13:46:44.513937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1502.05698","last_updated":"2015-12-31T13:08:14Z","snapshot_observed_at":"2026-07-06T04:09:45.600447Z","submitted_at":"2015-02-19T20:46:10Z","title":"Towards AI-Complete Question Answering: A Set of Prerequisite Toy Tasks","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.05698","snapshot_observed_at":"2026-08-09T13:46:43.529135Z","title":"M., van Merriënboer, B., Joulin, A., and Mikolov, T","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.529135Z"},"links":{"cited_paper":"/paper/1502.05698","citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:c4a41dbfe7cd449db42c84ceb56affdf644453cef99a55da186ab603755a0b60","observation_id":"0448aee8-c29c-46bb-825d-985cba3b0ada","resolution":{"observed_at":"2026-08-09T13:46:43.529135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:44.491119Z","title":"On the noisy gradient descent that generalizes as sgd","venue":null,"work_id":"8982a27e-a14d-4ba8-b25d-5aa4dd5d0cd7","year":2020},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.534025Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:89f3bd80bd447d220ba1b5ca17ad8b374c8055318f3ffd3842accfe32fcd2a5a","observation_id":"7fcd35b3-2ada-4779-b3dc-6ee73103d0c0","resolution":{"observed_at":"2026-08-09T13:46:44.496363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:44.475916Z","title":"How sgd selects the global minima in over-parameterized learning: A dynamical stability perspective","venue":null,"work_id":"bbe299cf-04e3-4fab-943a-4600830de05a","year":2018},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.539227Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:2ab17c87626307675144dd17061fbeea5236522afd7ea043eec6ce9b12e4713a","observation_id":"21ebed3d-a2d9-431a-a33c-299eba61061f","resolution":{"observed_at":"2026-08-09T13:46:44.480659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04946","last_updated":"2021-04-11T07:43:19Z","snapshot_observed_at":"2026-08-10T12:52:25.795222Z","submitted_at":"2021-04-11T07:43:19Z","title":"UniDrop: A Simple yet Effective Technique to Improve Transformer without Extra Cost","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.04946","snapshot_observed_at":"2026-08-09T13:46:43.544075Z","title":"Unidrop: A simple yet effective technique to improve transformer without extra cost, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.544075Z"},"links":{"cited_paper":"/paper/2104.04946","citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:351b0387549c7cc7299de4c035e7ba2ff660bfd06ee6bc2d0825c197c441d12d","observation_id":"e45537e8-832f-4ceb-9a8b-bfad031b41e3","resolution":{"observed_at":"2026-08-09T13:46:43.544075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:43.549000Z","title":"D., and Potts, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.549000Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:8225461da4d31abb04a234ad6ac4a27d7d1eabd845801e6e636f8fbefd8235ef","observation_id":"87d8e884-4966-49fa-aae4-9ba4027f9c3c","resolution":{"observed_at":"2026-08-09T13:46:43.549000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.03495","last_updated":"2021-01-15T14:57:46Z","snapshot_observed_at":"2026-07-06T08:55:58.482745Z","submitted_at":"2020-02-10T02:04:49Z","title":"A Diffusion Theory For Deep Learning Dynamics: Stochastic Gradient Descent Exponentially Favors Flat Minima","version":14},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.03495","snapshot_observed_at":"2026-08-09T13:46:43.554031Z","title":"A diffusion theory for deep learning dynamics: Stochastic gradient descent exponentially favors flat minima","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.554031Z"},"links":{"cited_paper":"/paper/2002.03495","citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:9186a7c267a8a1ca169c04fba69417ccffb15f93636a877ee613e0a3c99633ae","observation_id":"93be4192-acd6-4e66-9346-1ba25f5a8a5f","resolution":{"observed_at":"2026-08-09T13:46:43.554031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:44.460776Z","title":"URL http://www.yelp.com/ dataset_challenge","venue":null,"work_id":"42f237b7-3d6e-4e21-9bf0-6f0e145d22a7","year":2014},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.559095Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:30726ef2e33fdbec7b81805f645e1405cfe38399e0bd2a749f499de6cefa9fd0","observation_id":"ef9ae870-53ef-4629-90b6-895e2c03ed87","resolution":{"observed_at":"2026-08-09T13:46:44.465135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06332","last_updated":"2024-05-24T07:09:21Z","snapshot_observed_at":"2026-08-10T07:06:15.150032Z","submitted_at":"2024-02-09T11:22:08Z","title":"InternLM-Math: Open Math Large Language Models Toward Verifiable Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06332","snapshot_observed_at":"2026-08-09T13:46:43.563724Z","title":"Internlm-math: Open math large language models toward verifiable reasoning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.563724Z"},"links":{"cited_paper":"/paper/2402.06332","citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:1813cabfd717a9f8f1dd2023f2cbe744f5a3b34ca09113f9dfb2e30da13b8130","observation_id":"ffb8e00d-fa33-4783-b3d8-65f358a901f5","resolution":{"observed_at":"2026-08-09T13:46:43.563724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:43.568890Z","title":"Natural language reasoning, a survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.568890Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:f5c9bf9828ec49349dca01d5077bf68b849315345c8d3ffbe6a015f29d2dd57a","observation_id":"c837e3f2-6754-489a-a334-e4e3b937e06f","resolution":{"observed_at":"2026-08-09T13:46:43.568890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11065","last_updated":"2019-07-26T01:49:33Z","snapshot_observed_at":"2026-08-06T20:13:09.688197Z","submitted_at":"2019-07-25T14:03:06Z","title":"DropAttention: A Regularization Method for Fully-Connected Self-Attention Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11065","snapshot_observed_at":"2026-08-09T13:46:43.573794Z","title":"Dropattention: A regularization method for fully-connected self-attention networks, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.573794Z"},"links":{"cited_paper":"/paper/1907.11065","citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:92f4660e6bd0c39097b72821d8553218f0895b86b511094e7c16b00a71ab7856","observation_id":"7752d722-275c-47e2-a23a-c363ea5c1b53","resolution":{"observed_at":"2026-08-09T13:46:43.573794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:43.579115Z","title":"Dropdim: A regularization method for transformer networks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.579115Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:9428dccc3a3b9df241b403da770a670ce442442cce70d0ba1f9a8b39575b6374","observation_id":"3b913036-4a56-4b15-87c9-92fa484ac6e2","resolution":{"observed_at":"2026-08-09T13:46:43.579115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:43.583817Z","title":"H., Meng, T., Chang, K.-W., and Van den Broeck, G","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.583817Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:8af6e88eb5c36d508e79e24e0db239835e7179f38c10505fba1b36e54c9a12a7","observation_id":"74d55690-5c9c-4951-b325-91bfac772083","resolution":{"observed_at":"2026-08-09T13:46:43.583817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:43.588944Z","title":"and Xu, Z.-Q","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.588944Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:4d32e76850788094e1d515d1e439d72de03c03ba57619305a8ab55891911ceee","observation_id":"33ebdccc-6c5d-42b1-8b4f-0d681e7bd3f0","resolution":{"observed_at":"2026-08-09T13:46:43.588944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15850","last_updated":"2023-05-25T08:42:25Z","snapshot_observed_at":"2026-08-10T04:00:57.539379Z","submitted_at":"2023-05-25T08:42:25Z","title":"Stochastic Modified Equations and Dynamics of Dropout Algorithm","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15850","snapshot_observed_at":"2026-08-09T13:46:43.594201Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.594201Z"},"links":{"cited_paper":"/paper/2305.15850","citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:ec43006501ff9b41da035b70274f77bb6779373a8b98ed35eba161a6fc664299","observation_id":"f61a50ba-e91a-4684-979c-b1dcc1ae298b","resolution":{"observed_at":"2026-08-09T13:46:43.594201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05409","last_updated":"2025-01-13T11:35:37Z","snapshot_observed_at":"2026-08-08T23:06:46.773327Z","submitted_at":"2024-05-08T20:23:24Z","title":"Initialization is Critical to Whether Transformers Fit Composite Functions by Reasoning or Memorizing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05409","snapshot_observed_at":"2026-08-09T13:46:43.599362Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.599362Z"},"links":{"cited_paper":"/paper/2405.05409","citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:b9ef22bb5de37882307198f1217264fb8b022662029a31cb55ac0df92cd2181e","observation_id":"98a53005-a589-4721-9d72-b65c5d036bc9","resolution":{"observed_at":"2026-08-09T13:46:43.599362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08309","last_updated":"2024-01-16T12:10:49Z","snapshot_observed_at":"2026-08-10T07:07:03.830031Z","submitted_at":"2024-01-16T12:10:49Z","title":"Anchor function: a type of benchmark functions for studying language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08309","snapshot_observed_at":"2026-08-09T13:46:43.604752Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.604752Z"},"links":{"cited_paper":"/paper/2401.08309","citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:bf7db0c94f6f88cae928bbb2feb5d890b35e80b1d1e8024b296fc65ab25aa40a","observation_id":"bc20519d-1dad-4b65-ae7c-c7d1f8a0e807","resolution":{"observed_at":"2026-08-09T13:46:43.604752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:44.435406Z","title":"Implicit geometry of next-token prediction: From language sparsity patterns to model representations","venue":null,"work_id":"879ceae6-e9c8-45f4-9536-974cc58486dd","year":2024},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.609837Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:8eb03bd63d0ab0324411ff76aa9c9a77ec93f63ccb22acebaafe0cf3924d58b8","observation_id":"ddbdd9be-60e5-4cbb-8e00-b098c371f2df","resolution":{"observed_at":"2026-08-09T13:46:44.440791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:43.614551Z","title":"Scheduled D rop H ead: A regularization method for transformer models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.614551Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:13e0324260ef5cd6ff2053e22f2070e5f97877715026da869ac231f0ef6377eb","observation_id":"d9675f5f-907b-4fcc-814f-96896e1c0ded","resolution":{"observed_at":"2026-08-09T13:46:43.614551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:46:44.420027Z","title":"The anisotropic noise in stochastic gradient descent: Its behavior of escaping from sharp minima and regularization effects","venue":null,"work_id":"8f738f69-9d1c-4cd7-8ae2-0f7101ac6b92","year":2019},"citing_paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-09T13:46:43.619470Z"},"links":{"citing_paper":"/paper/2502.02007"},"observation_digest":"sha256:b01d6a07a35b1ef0a468766bc6571e508765454cd04e51f4fee2d23504e348f8","observation_id":"30af6bad-2d3a-4fcf-9b1f-dc57d4457767","resolution":{"observed_at":"2026-08-09T13:46:44.424735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.02007","last_updated":"2025-02-20T03:38:38Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T07:06:07.756557Z","submitted_at":"2025-02-04T04:46:41Z","title":"Reasoning Bias of Next Token Prediction Training"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":5,"verified_fuzzy":23},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 1 inbound Pith citation observation for arXiv:2502.02007."}