{"as_of":"2026-08-17T10:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6215e0ffeb63208e22fa07771c675ddfd45a33138b1f79bae22873dfcdc08494","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:39:55.113761Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T20:57:10.776717Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-28T23:42:49.961290Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.00926","last_updated":"2025-05-28T23:17:46Z","snapshot_observed_at":"2026-08-16T23:22:20.646457Z","submitted_at":"2025-05-02T00:07:35Z","title":"How Transformers Learn Regular Language Recognition: A Theoretical Study on Training Dynamics and Implicit Bias","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00926","snapshot_observed_at":"2026-08-03T20:57:10.776717Z","title":"How transformers learn regular language recognition: A theoretical study on training dynamics and implicit bias, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.17852","last_updated":"2026-08-06T09:30:47Z","snapshot_observed_at":"2026-08-09T23:09:22.568411Z","submitted_at":"2025-11-22T00:38:43Z","title":"Transformers with RL or SFT Provably Learn Sparse Boolean Functions, But Differently","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-03T20:57:10.776717Z"},"links":{"cited_paper":"/paper/2505.00926","citing_paper":"/paper/2511.17852"},"observation_digest":"sha256:602b75b92744dfd20bccb8b660af7116f74646dfdba9c07206b2fce019263e1b","observation_id":"b54f4b11-435e-45a8-9ac1-9f884743d67c","resolution":{"observed_at":"2026-08-03T20:57:10.776717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00926","last_updated":"2025-05-28T23:17:46Z","snapshot_observed_at":"2026-08-16T23:22:20.646457Z","submitted_at":"2025-05-02T00:07:35Z","title":"How Transformers Learn Regular Language Recognition: A Theoretical Study on Training Dynamics and Implicit Bias","version":3},"cited_work":{"arxiv_id":"2505.00926","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00926","snapshot_observed_at":"2026-06-28T23:42:49.961290Z","title":"arXiv preprint arXiv:2505.00926 , year=","venue":null,"work_id":"176250ab-3c90-4b2a-8aea-b35b994db543","year":null},"citing_paper":{"arxiv_id":"2606.00183","last_updated":"2026-05-29T14:58:03Z","snapshot_observed_at":"2026-08-13T00:33:18.445193Z","submitted_at":"2026-05-29T14:58:03Z","title":"Agentic Transformers Provably Learn to Search via Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-28T23:26:28.158991Z"},"links":{"cited_paper":"/paper/2505.00926","citing_paper":"/paper/2606.00183"},"observation_digest":"sha256:750112d5c4b40d6633fac7b124b345a0a9ae4181be7f20b7b5a917c0c913e1df","observation_id":"16c8f18c-5384-421d-95be-6c837185879a","resolution":{"observed_at":"2026-06-28T23:42:49.962665Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.00926/citation-record","integrity":"/paper/2505.00926/integrity","json":"/paper/2505.00926/citation-record.json","paper":"/paper/2505.00926"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.19442","last_updated":"2024-06-10T17:18:07Z","snapshot_observed_at":"2026-08-16T14:14:00.817200Z","submitted_at":"2024-02-29T18:43:52Z","title":"Training Dynamics of Multi-Head Softmax Attention for In-Context Learning: Emergence, Convergence, and Optimality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19442","snapshot_observed_at":"2026-08-16T04:39:54.990906Z","title":"Training dynamics of multi-head softmax attention for in-context learning: Emergence, convergence, and optimality","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00926","last_updated":"2025-05-28T23:17:46Z","snapshot_observed_at":"2026-08-16T23:22:20.646457Z","submitted_at":"2025-05-02T00:07:35Z","title":"How Transformers Learn Regular Language Recognition: A Theoretical Study on Training Dynamics and Implicit Bias","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T04:39:54.990906Z"},"links":{"cited_paper":"/paper/2402.19442","citing_paper":"/paper/2505.00926"},"observation_digest":"sha256:0d0af4bde1a05afe4c1d4c4157e72c4989faf252030f005fd14e3f639bbb0400","observation_id":"cdcfbd51-fa8a-40ac-97a3-b0915cb0119c","resolution":{"observed_at":"2026-08-16T04:39:54.990906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06528","last_updated":"2024-06-04T00:20:05Z","snapshot_observed_at":"2026-08-16T14:35:48.874202Z","submitted_at":"2023-12-11T17:05:25Z","title":"Transformers Implement Functional Gradient Descent to Learn Non-Linear Functions In Context","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06528","snapshot_observed_at":"2026-08-16T04:39:54.995663Z","title":"Transformers implement functional gradient descent to learn non-linear functions in context","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00926","last_updated":"2025-05-28T23:17:46Z","snapshot_observed_at":"2026-08-16T23:22:20.646457Z","submitted_at":"2025-05-02T00:07:35Z","title":"How Transformers Learn Regular Language Recognition: A Theoretical Study on Training Dynamics and Implicit Bias","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T04:39:54.995663Z"},"links":{"cited_paper":"/paper/2312.06528","citing_paper":"/paper/2505.00926"},"observation_digest":"sha256:d62e98a0b4b5ce0395c7c5eef797ede87574c10eb34a93d57c10be34f11778f6","observation_id":"18158418-9dd5-489e-8a7a-012a1f23fc06","resolution":{"observed_at":"2026-08-16T04:39:54.995663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.12172","last_updated":"2022-02-24T16:14:29Z","snapshot_observed_at":"2026-08-16T23:22:15.892772Z","submitted_at":"2022-02-24T16:14:29Z","title":"Overcoming a Theoretical Limitation of Self-Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.12172","snapshot_observed_at":"2026-08-16T04:39:55.000654Z","title":"and Cholak, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00926","last_updated":"2025-05-28T23:17:46Z","snapshot_observed_at":"2026-08-16T23:22:20.646457Z","submitted_at":"2025-05-02T00:07:35Z","title":"How Transformers Learn Regular Language Recognition: A Theoretical Study on Training Dynamics and Implicit Bias","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T04:39:55.000654Z"},"links":{"cited_paper":"/paper/2202.12172","citing_paper":"/paper/2505.00926"},"observation_digest":"sha256:a01b5b4625e9f13d8459e6cf0b43e9859de3de713882567bc18d9083c5320f92","observation_id":"799d9f0c-6b1f-413f-b6b3-c91d44b9317d","resolution":{"observed_at":"2026-08-16T04:39:55.000654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12680","last_updated":"2024-10-12T04:12:31Z","snapshot_observed_at":"2026-08-17T03:01:59.504460Z","submitted_at":"2023-10-19T12:18:24Z","title":"On the Optimization and Generalization of Multi-head Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12680","snapshot_observed_at":"2026-08-16T04:39:55.010451Z","title":"On the optimization and generalization of multi-head attention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00926","last_updated":"2025-05-28T23:17:46Z","snapshot_observed_at":"2026-08-16T23:22:20.646457Z","submitted_at":"2025-05-02T00:07:35Z","title":"How Transformers Learn Regular Language Recognition: A Theoretical Study on Training Dynamics and Implicit Bias","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T04:39:55.010451Z"},"links":{"cited_paper":"/paper/2310.12680","citing_paper":"/paper/2505.00926"},"observation_digest":"sha256:5a61a6897c738a2968b1196a4ec285ca365bf75b65d2c685e7b368477abd7c94","observation_id":"a7bf4afd-cb6f-4825-8f2a-7f3396c30c9d","resolution":{"observed_at":"2026-08-16T04:39:55.010451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-16T04:39:55.014925Z","title":"Bert: Pre-training of deep bidirectional transformers for lan- guage understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00926","last_updated":"2025-05-28T23:17:46Z","snapshot_observed_at":"2026-08-16T23:22:20.646457Z","submitted_at":"2025-05-02T00:07:35Z","title":"How Transformers Learn Regular Language Recognition: A Theoretical Study on Training Dynamics and Implicit Bias","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T04:39:55.014925Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2505.00926"},"observation_digest":"sha256:c5870c17411910c9fc3584b6aed9c1e0b640052cc792ad0e13d522826945a016","observation_id":"8f1bf8ba-7431-4872-8a8b-7c2865077a0f","resolution":{"observed_at":"2026-08-16T04:39:55.014925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00805","last_updated":"2018-08-21T00:02:44Z","snapshot_observed_at":"2026-08-14T21:08:29.545204Z","submitted_at":"2017-04-03T20:50:29Z","title":"On the Properties of the Softmax Function with Application in Game Theory and Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.00805","snapshot_observed_at":"2026-08-16T04:39:55.024520Z","title":"and Pavel, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00926","last_updated":"2025-05-28T23:17:46Z","snapshot_observed_at":"2026-08-16T23:22:20.646457Z","submitted_at":"2025-05-02T00:07:35Z","title":"How Transformers Learn Regular Language Recognition: A Theoretical Study on Training Dynamics and Implicit Bias","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T04:39:55.024520Z"},"links":{"cited_paper":"/paper/1704.00805","citing_paper":"/paper/2505.00926"},"observation_digest":"sha256:ebc75e42f1997748df4f73ae209bf28a682b6c8d295170d687eebaafe177da08","observation_id":"3232a6ae-4d9f-43c1-aee1-9f9a9fff8c40","resolution":{"observed_at":"2026-08-16T04:39:55.024520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05249","last_updated":"2023-10-08T17:55:33Z","snapshot_observed_at":"2026-08-17T09:47:37.660340Z","submitted_at":"2023-10-08T17:55:33Z","title":"In-Context Convergence of Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05249","snapshot_observed_at":"2026-08-16T04:39:55.033194Z","title":"Non-asymptotic conver- gence of training transformers for next-token prediction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00926","last_updated":"2025-05-28T23:17:46Z","snapshot_observed_at":"2026-08-16T23:22:20.646457Z","submitted_at":"2025-05-02T00:07:35Z","title":"How Transformers Learn Regular Language Recognition: A Theoretical Study on Training Dynamics and Implicit Bias","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T04:39:55.033194Z"},"links":{"cited_paper":"/paper/2310.05249","citing_paper":"/paper/2505.00926"},"observation_digest":"sha256:4768ac61eb67d2202c740ac49229784153bee19bd6972e2e72d22d549ef4129f","observation_id":"b1de9036-333e-45a3-826a-9c832158e0a3","resolution":{"observed_at":"2026-08-16T04:39:55.033194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02233","last_updated":"2025-02-05T14:22:26Z","snapshot_observed_at":"2026-08-16T14:12:59.195568Z","submitted_at":"2024-03-04T17:24:03Z","title":"A Theoretical Analysis of Self-Supervised Learning for Vision Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02233","snapshot_observed_at":"2026-08-16T04:39:55.038985Z","title":"How transform- ers learn diverse attention correlations in masked vision pretraining","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00926","last_updated":"2025-05-28T23:17:46Z","snapshot_observed_at":"2026-08-16T23:22:20.646457Z","submitted_at":"2025-05-02T00:07:35Z","title":"How Transformers Learn Regular Language Recognition: A Theoretical Study on Training Dynamics and Implicit Bias","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T04:39:55.038985Z"},"links":{"cited_paper":"/paper/2403.02233","citing_paper":"/paper/2505.00926"},"observation_digest":"sha256:2c75879df33d7147eb0cd1023e48c0aeb9b9c3b52a99d0ec017104b0f9e3bfb0","observation_id":"11777658-631e-4e64-a941-589384b125ef","resolution":{"observed_at":"2026-08-16T04:39:55.038985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01258","last_updated":"2024-06-02T06:31:43Z","snapshot_observed_at":"2026-08-16T14:22:12.830097Z","submitted_at":"2024-02-02T09:29:40Z","title":"Transformers Learn Nonlinear Features In Context: Nonconvex Mean-field Dynamics on the Attention Landscape","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01258","snapshot_observed_at":"2026-08-16T04:39:55.048091Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00926","last_updated":"2025-05-28T23:17:46Z","snapshot_observed_at":"2026-08-16T23:22:20.646457Z","submitted_at":"2025-05-02T00:07:35Z","title":"How Transformers Learn Regular Language Recognition: A Theoretical Study on Training Dynamics and Implicit Bias","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T04:39:55.048091Z"},"links":{"cited_paper":"/paper/2402.01258","citing_paper":"/paper/2505.00926"},"observation_digest":"sha256:05c227aecda7f440104e661ccfcaebc2be733028ad5050194e59ca9e85c8aa4d","observation_id":"456a1a31-bddc-4d14-ade5-db6d5590bd62","resolution":{"observed_at":"2026-08-16T04:39:55.048091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.06015","last_updated":"2023-11-12T04:36:45Z","snapshot_observed_at":"2026-08-16T15:55:54.753970Z","submitted_at":"2023-02-12T22:12:35Z","title":"A Theoretical Understanding of Shallow Vision Transformers: Learning, Generalization, and Sample Complexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.06015","snapshot_observed_at":"2026-08-16T04:39:55.052535Z","title":"A theoretical understanding of shallow vision transformers: Learning, generalization, and sample complexity","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00926","last_updated":"2025-05-28T23:17:46Z","snapshot_observed_at":"2026-08-16T23:22:20.646457Z","submitted_at":"2025-05-02T00:07:35Z","title":"How Transformers Learn Regular Language Recognition: A Theoretical Study on Training Dynamics and Implicit Bias","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T04:39:55.052535Z"},"links":{"cited_paper":"/paper/2302.06015","citing_paper":"/paper/2505.00926"},"observation_digest":"sha256:f92c0e92254db56986db3677be55de4938ec589033b32d043370048d53ce9181","observation_id":"06b3ef20-65e2-4861-94a3-5e285381d92a","resolution":{"observed_at":"2026-08-16T04:39:55.052535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02167","last_updated":"2025-05-25T07:45:42Z","snapshot_observed_at":"2026-08-16T13:13:06.497933Z","submitted_at":"2024-10-03T03:12:51Z","title":"Training Nonlinear Transformers for Chain-of-Thought Inference: A Theoretical Generalization Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02167","snapshot_observed_at":"2026-08-16T04:39:55.057589Z","title":"Training nonlinear transformers for chain-of-thought inference: A theoretical generalization analysis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00926","last_updated":"2025-05-28T23:17:46Z","snapshot_observed_at":"2026-08-16T23:22:20.646457Z","submitted_at":"2025-05-02T00:07:35Z","title":"How Transformers Learn Regular Language Recognition: A Theoretical Study on Training Dynamics and Implicit Bias","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T04:39:55.057589Z"},"links":{"cited_paper":"/paper/2410.02167","citing_paper":"/paper/2505.00926"},"observation_digest":"sha256:088293aa9373435a20feeb94fbcce12d4051c291fe952ef34f70e43da0bb3b03","observation_id":"a87cda34-ab35-4ad1-91e6-5dfdb3acde01","resolution":{"observed_at":"2026-08-16T04:39:55.057589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03576","last_updated":"2023-07-07T13:09:18Z","snapshot_observed_at":"2026-08-16T15:17:57.789299Z","submitted_at":"2023-07-07T13:09:18Z","title":"One Step of Gradient Descent is Provably the Optimal In-Context Learner with One Layer of Linear Self-Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03576","snapshot_observed_at":"2026-08-16T04:39:55.061423Z","title":"B., and Ma, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00926","last_updated":"2025-05-28T23:17:46Z","snapshot_observed_at":"2026-08-16T23:22:20.646457Z","submitted_at":"2025-05-02T00:07:35Z","title":"How Transformers Learn Regular Language Recognition: A Theoretical Study on Training Dynamics and Implicit Bias","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T04:39:55.061423Z"},"links":{"cited_paper":"/paper/2307.03576","citing_paper":"/paper/2505.00926"},"observation_digest":"sha256:dd70c70ce2ff9d3f21c60161a66115e493e1257cadf280b777a31022023ee606","observation_id":"b139b00c-2f00-4bc6-aeb4-4bcc0712611d","resolution":{"observed_at":"2026-08-16T04:39:55.061423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07923","last_updated":"2024-04-11T18:03:53Z","snapshot_observed_at":"2026-08-16T23:21:29.490443Z","submitted_at":"2023-10-11T22:35:18Z","title":"The Expressive Power of Transformers with Chain of Thought","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07923","snapshot_observed_at":"2026-08-16T04:39:55.065880Z","title":"and Sabharwal, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00926","last_updated":"2025-05-28T23:17:46Z","snapshot_observed_at":"2026-08-16T23:22:20.646457Z","submitted_at":"2025-05-02T00:07:35Z","title":"How Transformers Learn Regular Language Recognition: A Theoretical Study on Training Dynamics and Implicit Bias","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T04:39:55.065880Z"},"links":{"cited_paper":"/paper/2310.07923","citing_paper":"/paper/2505.00926"},"observation_digest":"sha256:67577ef4195584d796c6c9c48cb721a32bb64b480e728af1a10e006100ef2056","observation_id":"3849a41a-2628-416c-a463-68a4e5478a53","resolution":{"observed_at":"2026-08-16T04:39:55.065880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:39:55.499822Z","title":null,"venue":null,"work_id":"4a6a8f91-f00d-462b-9891-b0b922e275d9","year":2021},"citing_paper":{"arxiv_id":"2505.00926","last_updated":"2025-05-28T23:17:46Z","snapshot_observed_at":"2026-08-16T23:22:20.646457Z","submitted_at":"2025-05-02T00:07:35Z","title":"How Transformers Learn Regular Language Recognition: A Theoretical Study on Training Dynamics and Implicit Bias","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T04:39:55.070888Z"},"links":{"citing_paper":"/paper/2505.00926"},"observation_digest":"sha256:005debfe4086529f2701320b47fdfba23b233d0a648366064c0ecbb4e79217b0","observation_id":"579ba2f9-5294-4944-a8ef-4175aa5d9664","resolution":{"observed_at":"2026-08-16T04:39:55.504372Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17625","last_updated":"2025-05-17T17:16:53Z","snapshot_observed_at":"2026-08-16T13:15:14.181352Z","submitted_at":"2024-09-26T08:20:05Z","title":"Benign Overfitting in Token Selection of Attention Mechanism","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17625","snapshot_observed_at":"2026-08-16T04:39:55.078557Z","title":"and Sato, I","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00926","last_updated":"2025-05-28T23:17:46Z","snapshot_observed_at":"2026-08-16T23:22:20.646457Z","submitted_at":"2025-05-02T00:07:35Z","title":"How Transformers Learn Regular Language Recognition: A Theoretical Study on Training Dynamics and Implicit Bias","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T04:39:55.078557Z"},"links":{"cited_paper":"/paper/2409.17625","citing_paper":"/paper/2505.00926"},"observation_digest":"sha256:ccd49edc31699df471d3fc8b69066d94aeac4d7acf3bd62a35f6bda2bbf6eff7","observation_id":"27895490-f6d5-404a-ac19-e0b2a9814f1a","resolution":{"observed_at":"2026-08-16T04:39:55.078557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08699","last_updated":"2024-03-13T17:02:27Z","snapshot_observed_at":"2026-08-16T14:10:06.555220Z","submitted_at":"2024-03-13T17:02:27Z","title":"Implicit Regularization of Gradient Flow on One-Layer Softmax Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08699","snapshot_observed_at":"2026-08-16T04:39:55.082521Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00926","last_updated":"2025-05-28T23:17:46Z","snapshot_observed_at":"2026-08-16T23:22:20.646457Z","submitted_at":"2025-05-02T00:07:35Z","title":"How Transformers Learn Regular Language Recognition: A Theoretical Study on Training Dynamics and Implicit Bias","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T04:39:55.082521Z"},"links":{"cited_paper":"/paper/2403.08699","citing_paper":"/paper/2505.00926"},"observation_digest":"sha256:42274d491017e40b9c2e5b597a64e90af59c508e36fa126d3a6ac590e34451b7","observation_id":"439fd820-6ffa-4b94-a19f-4ca19600d8d0","resolution":{"observed_at":"2026-08-16T04:39:55.082521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16898","last_updated":"2024-02-22T18:38:14Z","snapshot_observed_at":"2026-08-16T15:04:13.161124Z","submitted_at":"2023-08-31T17:57:50Z","title":"Transformers as Support Vector Machines","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16898","snapshot_observed_at":"2026-08-16T04:39:55.086987Z","title":"A., Li, Y ., Thrampoulidis, C., and Oymak, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00926","last_updated":"2025-05-28T23:17:46Z","snapshot_observed_at":"2026-08-16T23:22:20.646457Z","submitted_at":"2025-05-02T00:07:35Z","title":"How Transformers Learn Regular Language Recognition: A Theoretical Study on Training Dynamics and Implicit Bias","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T04:39:55.086987Z"},"links":{"cited_paper":"/paper/2308.16898","citing_paper":"/paper/2505.00926"},"observation_digest":"sha256:9d44def74a149371555fa1f168eb9c222e032387acc1e0df9b4dcfc059552a8c","observation_id":"7c15a587-fc9f-4354-9f9f-9ef84f2a3456","resolution":{"observed_at":"2026-08-16T04:39:55.086987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00535","last_updated":"2024-03-15T02:03:21Z","snapshot_observed_at":"2026-08-16T14:56:11.371633Z","submitted_at":"2023-10-01T01:21:35Z","title":"JoMA: Demystifying Multilayer Transformers via JOint Dynamics of MLP and Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00535","snapshot_observed_at":"2026-08-16T04:39:55.092241Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00926","last_updated":"2025-05-28T23:17:46Z","snapshot_observed_at":"2026-08-16T23:22:20.646457Z","submitted_at":"2025-05-02T00:07:35Z","title":"How Transformers Learn Regular Language Recognition: A Theoretical Study on Training Dynamics and Implicit Bias","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T04:39:55.092241Z"},"links":{"cited_paper":"/paper/2310.00535","citing_paper":"/paper/2505.00926"},"observation_digest":"sha256:31949ca2f740d9d0938fb1c91f0785a570caf5f07d2072d75cb23982a437e1c1","observation_id":"379d2c9c-b268-487a-aa25-0cdb2c8605b7","resolution":{"observed_at":"2026-08-16T04:39:55.092241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05738","last_updated":"2025-03-31T06:17:02Z","snapshot_observed_at":"2026-08-16T14:20:11.807280Z","submitted_at":"2024-02-08T15:15:09Z","title":"Implicit Bias and Fast Convergence Rates for Self-attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05738","snapshot_observed_at":"2026-08-16T04:39:55.096841Z","title":"Implicit bias and fast convergence rates for self-attention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00926","last_updated":"2025-05-28T23:17:46Z","snapshot_observed_at":"2026-08-16T23:22:20.646457Z","submitted_at":"2025-05-02T00:07:35Z","title":"How Transformers Learn Regular Language Recognition: A Theoretical Study on Training Dynamics and Implicit Bias","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T04:39:55.096841Z"},"links":{"cited_paper":"/paper/2402.05738","citing_paper":"/paper/2505.00926"},"observation_digest":"sha256:55c0b5780f94e7ea60019a1c61d551ebfa1343ee611b7311aec10bf75bcaa45b","observation_id":"6a95aef2-5781-4583-a80b-64ac21e2cd4e","resolution":{"observed_at":"2026-08-16T04:39:55.096841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05459","last_updated":"2025-03-05T13:57:56Z","snapshot_observed_at":"2026-08-16T13:11:45.819514Z","submitted_at":"2024-10-07T19:45:09Z","title":"From Sparse Dependence to Sparse Attention: Unveiling How Chain-of-Thought Enhances Transformer Sample Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05459","snapshot_observed_at":"2026-08-16T04:39:55.101972Z","title":"From sparse dependence to sparse attention: Unveiling how chain-of- thought enhances transformer sample efficiency","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00926","last_updated":"2025-05-28T23:17:46Z","snapshot_observed_at":"2026-08-16T23:22:20.646457Z","submitted_at":"2025-05-02T00:07:35Z","title":"How Transformers Learn Regular Language Recognition: A Theoretical Study on Training Dynamics and Implicit Bias","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T04:39:55.101972Z"},"links":{"cited_paper":"/paper/2410.05459","citing_paper":"/paper/2505.00926"},"observation_digest":"sha256:91a238233ece83e5b24842817be8aaec8c1446379a287c9b0faf53242d02cd98","observation_id":"471940bf-60e2-48b6-bc36-428bcb39696a","resolution":{"observed_at":"2026-08-16T04:39:55.101972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09927","last_updated":"2023-10-19T20:31:32Z","snapshot_observed_at":"2026-08-16T15:23:17.868564Z","submitted_at":"2023-06-16T15:50:03Z","title":"Trained Transformers Learn Linear Models In-Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09927","snapshot_observed_at":"2026-08-16T04:39:55.105878Z","title":"Train- ing dynamics of transformers to recognize word co- occurrence via gradient flow analysis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00926","last_updated":"2025-05-28T23:17:46Z","snapshot_observed_at":"2026-08-16T23:22:20.646457Z","submitted_at":"2025-05-02T00:07:35Z","title":"How Transformers Learn Regular Language Recognition: A Theoretical Study on Training Dynamics and Implicit Bias","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T04:39:55.105878Z"},"links":{"cited_paper":"/paper/2306.09927","citing_paper":"/paper/2505.00926"},"observation_digest":"sha256:1c8a68648f8c7f686a9f5b6962cb40005e03cc97d302652db5f4a5d2ec700e23","observation_id":"2aebcc4d-0092-45f9-8b07-40dd5df9ed25","resolution":{"observed_at":"2026-08-16T04:39:55.105878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:39:55.486143Z","title":"Auxiliary Lemmas and Equations Lemma A.1 (Gao & Pavel (2017))","venue":null,"work_id":"dce186a7-88d1-498d-bf76-eb82df13804b","year":2017},"citing_paper":{"arxiv_id":"2505.00926","last_updated":"2025-05-28T23:17:46Z","snapshot_observed_at":"2026-08-16T23:22:20.646457Z","submitted_at":"2025-05-02T00:07:35Z","title":"How Transformers Learn Regular Language Recognition: A Theoretical Study on Training Dynamics and Implicit Bias","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T04:39:55.109869Z"},"links":{"citing_paper":"/paper/2505.00926"},"observation_digest":"sha256:7ad817c7cf39126fad65a82485c12eb7f7a93720b332589493b02adf1a40d6b0","observation_id":"b0c9f10c-2b93-4a6e-91aa-7cbb25e75fc3","resolution":{"observed_at":"2026-08-16T04:39:55.490887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:39:55.472956Z","title":"This can be done by noting that⟨u2,Ew 1 −E2 ℓ⟩≥ Ω(η) forℓ̸=ℓ0","venue":null,"work_id":"ca9b998a-0169-4c87-a3b3-19ceb277bad1","year":2023},"citing_paper":{"arxiv_id":"2505.00926","last_updated":"2025-05-28T23:17:46Z","snapshot_observed_at":"2026-08-16T23:22:20.646457Z","submitted_at":"2025-05-02T00:07:35Z","title":"How Transformers Learn Regular Language Recognition: A Theoretical Study on Training Dynamics and Implicit Bias","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T04:39:55.113761Z"},"links":{"citing_paper":"/paper/2505.00926"},"observation_digest":"sha256:d0ba3b426640bb1badcd436b5b1ede262fcfdf07862f9257188ff9c86cda3a1e","observation_id":"704aca31-5cd0-4508-b99a-4b474790b8d9","resolution":{"observed_at":"2026-08-16T04:39:55.478138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07082","last_updated":"2022-10-13T15:09:54Z","snapshot_observed_at":"2026-08-16T16:24:27.533591Z","submitted_at":"2022-10-13T15:09:54Z","title":"Implicit Bias in Leaky ReLU Networks Trained on High-Dimensional Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07082","snapshot_observed_at":"2026-08-16T04:39:55.019942Z","title":"L., Srebro, N., and Hu, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00926","last_updated":"2025-05-28T23:17:46Z","snapshot_observed_at":"2026-08-16T23:22:20.646457Z","submitted_at":"2025-05-02T00:07:35Z","title":"How Transformers Learn Regular Language Recognition: A Theoretical Study on Training Dynamics and Implicit Bias","version":3},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-16T04:39:55.019942Z"},"links":{"cited_paper":"/paper/2210.07082","citing_paper":"/paper/2505.00926"},"observation_digest":"sha256:3f5ec066c9f672cee5f32484cd3058b5e06e757c4af52300c5471df13a9e6b77","observation_id":"0beb3973-5f06-4848-9285-64e2c0825a93","resolution":{"observed_at":"2026-08-16T04:39:55.019942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14735","last_updated":"2024-08-13T15:45:37Z","snapshot_observed_at":"2026-08-16T14:16:09.696469Z","submitted_at":"2024-02-22T17:47:03Z","title":"How Transformers Learn Causal Structure with Gradient Descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14735","snapshot_observed_at":"2026-08-16T04:39:55.074860Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00926","last_updated":"2025-05-28T23:17:46Z","snapshot_observed_at":"2026-08-16T23:22:20.646457Z","submitted_at":"2025-05-02T00:07:35Z","title":"How Transformers Learn Regular Language Recognition: A Theoretical Study on Training Dynamics and Implicit Bias","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-16T04:39:55.074860Z"},"links":{"cited_paper":"/paper/2402.14735","citing_paper":"/paper/2505.00926"},"observation_digest":"sha256:12e04f0793cb7916950108e6defa9fd12deebaf41e6278bd91e7443e150ff709","observation_id":"67f1ecc1-9c23-48f5-b26a-ca3dbb3303aa","resolution":{"observed_at":"2026-08-16T04:39:55.074860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09963","last_updated":"2024-05-27T17:01:29Z","snapshot_observed_at":"2026-08-16T14:18:18.310631Z","submitted_at":"2024-02-15T14:17:51Z","title":"Why are Sensitive Functions Hard for Transformers?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09963","snapshot_observed_at":"2026-08-16T04:39:55.028824Z","title":"and Rofin, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00926","last_updated":"2025-05-28T23:17:46Z","snapshot_observed_at":"2026-08-16T23:22:20.646457Z","submitted_at":"2025-05-02T00:07:35Z","title":"How Transformers Learn Regular Language Recognition: A Theoretical Study on Training Dynamics and Implicit Bias","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-16T04:39:55.028824Z"},"links":{"cited_paper":"/paper/2402.09963","citing_paper":"/paper/2505.00926"},"observation_digest":"sha256:3ecaa3b0833ac6292fbce0c4f0d3f04c5dc910fac2f98ec47d221f8d8c7007e1","observation_id":"dd26e19c-2269-43b7-b139-cc5fea7b213b","resolution":{"observed_at":"2026-08-16T04:39:55.028824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19345","last_updated":"2024-11-22T11:24:39Z","snapshot_observed_at":"2026-08-16T13:14:32.470535Z","submitted_at":"2024-09-28T13:24:11Z","title":"Unveil Benign Overfitting for Transformer in Vision: Training Dynamics, Convergence, and Generalization","version":2},"cited_work":{"arxiv_id":"2409.19345","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.19345","snapshot_observed_at":"2026-08-16T04:39:55.305651Z","title":"Unveil Benign Overfitting for Transformer in Vision: Training Dynamics, Convergence, and Generalization","venue":"cs.LG","work_id":"59c8bd72-e41d-4c7b-a4a5-6f75f7ec5108","year":2024},"citing_paper":{"arxiv_id":"2505.00926","last_updated":"2025-05-28T23:17:46Z","snapshot_observed_at":"2026-08-16T23:22:20.646457Z","submitted_at":"2025-05-02T00:07:35Z","title":"How Transformers Learn Regular Language Recognition: A Theoretical Study on Training Dynamics and Implicit Bias","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-16T04:39:55.043170Z"},"links":{"cited_paper":"/paper/2409.19345","citing_paper":"/paper/2505.00926"},"observation_digest":"sha256:060ccc6d5cf54a7272e7482bbb80b834e036f02709c6816704dc04feaf72c685","observation_id":"267c3f93-77d8-43d0-ba85-389b4d88ce17","resolution":{"observed_at":"2026-08-16T04:39:55.311900Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17426","last_updated":"2024-01-30T20:29:06Z","snapshot_observed_at":"2026-08-16T14:23:05.649699Z","submitted_at":"2024-01-30T20:29:06Z","title":"Superiority of Multi-Head Attention in In-Context Linear Regression","version":1},"cited_work":{"arxiv_id":"2401.17426","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.17426","snapshot_observed_at":"2026-08-16T04:39:55.403300Z","title":"Superiority of Multi-Head Attention in In-Context Linear Regression","venue":"cs.LG","work_id":"a37c007c-33fd-4518-af34-f20f92333e63","year":2024},"citing_paper":{"arxiv_id":"2505.00926","last_updated":"2025-05-28T23:17:46Z","snapshot_observed_at":"2026-08-16T23:22:20.646457Z","submitted_at":"2025-05-02T00:07:35Z","title":"How Transformers Learn Regular Language Recognition: A Theoretical Study on Training Dynamics and Implicit Bias","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-16T04:39:55.005255Z"},"links":{"cited_paper":"/paper/2401.17426","citing_paper":"/paper/2505.00926"},"observation_digest":"sha256:c38c3b9283e7555ff682837a369c182a976fabaa5240a7789158694e95df869a","observation_id":"fb8d970e-59c1-4cb6-a089-55a7073a6925","resolution":{"observed_at":"2026-08-16T04:39:55.407581Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04084","last_updated":"2024-02-06T15:39:09Z","snapshot_observed_at":"2026-08-16T14:20:58.371034Z","submitted_at":"2024-02-06T15:39:09Z","title":"Provably learning a multi-head attention layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04084","snapshot_observed_at":"2026-08-16T04:39:54.985634Z","title":"and Li, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00926","last_updated":"2025-05-28T23:17:46Z","snapshot_observed_at":"2026-08-16T23:22:20.646457Z","submitted_at":"2025-05-02T00:07:35Z","title":"How Transformers Learn Regular Language Recognition: A Theoretical Study on Training Dynamics and Implicit Bias","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-16T04:39:54.985634Z"},"links":{"cited_paper":"/paper/2402.04084","citing_paper":"/paper/2505.00926"},"observation_digest":"sha256:3d4734b76d5ed39679e51ab2428edfcbe0b6316795220da48563fd5f993924f6","observation_id":"6d55574b-e675-4f26-ac77-97799f6e2fa2","resolution":{"observed_at":"2026-08-16T04:39:54.985634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.11264","last_updated":"2020-10-08T12:55:37Z","snapshot_observed_at":"2026-08-08T13:16:05.781323Z","submitted_at":"2020-09-23T17:21:33Z","title":"On the Ability and Limitations of Transformers to Recognize Formal Languages","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.11264","snapshot_observed_at":"2026-08-16T04:39:54.980591Z","title":"On the abil- ity and limitations of transformers to recognize formal languages","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.00926","last_updated":"2025-05-28T23:17:46Z","snapshot_observed_at":"2026-08-16T23:22:20.646457Z","submitted_at":"2025-05-02T00:07:35Z","title":"How Transformers Learn Regular Language Recognition: A Theoretical Study on Training Dynamics and Implicit Bias","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-16T04:39:54.980591Z"},"links":{"cited_paper":"/paper/2009.11264","citing_paper":"/paper/2505.00926"},"observation_digest":"sha256:ddc1d0426539c2f4f348eb72d3053513703b6c85630a30cdb46bca663a67a2e3","observation_id":"8fbe3cd4-788c-44c5-8cde-21f2c77b66ea","resolution":{"observed_at":"2026-08-16T04:39:54.980591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.00926","last_updated":"2025-05-28T23:17:46Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T23:22:20.646457Z","submitted_at":"2025-05-02T00:07:35Z","title":"How Transformers Learn Regular Language Recognition: A Theoretical Study on Training Dynamics and Implicit Bias"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":2,"verified_fuzzy":2},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 2 inbound Pith citation observations for arXiv:2505.00926."}