{"as_of":"2026-08-22T05:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4976b1ca42ed9bde95749234225befb70a1a0f26ca6b1c48fe61346e06996b2e","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T10:29:08.945338Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.16683/citation-record","integrity":"/paper/2412.16683/integrity","json":"/paper/2412.16683/citation-record.json","paper":"/paper/2412.16683"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:29:09.209494Z","title":"Trans- formers learn to implement preconditioned gradient descent for in-context learning","venue":null,"work_id":"14edefb7-c1b6-4bac-927e-11e5483354ff","year":2023},"citing_paper":{"arxiv_id":"2412.16683","last_updated":"2024-12-21T16:18:59Z","snapshot_observed_at":"2026-08-21T19:46:12.835852Z","submitted_at":"2024-12-21T16:18:59Z","title":"Dynamical Behaviors of the Gradient Flows for In-Context Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T10:29:08.866264Z"},"links":{"citing_paper":"/paper/2412.16683"},"observation_digest":"sha256:74f2de95eaa4e5ae9d19536ac4ba2b5f3ed213d22afd8bbec0048bb6ac1bf05b","observation_id":"15e674d8-9f5c-4f80-a03c-88670f30f1cb","resolution":{"observed_at":"2026-08-11T10:29:09.213504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:29:09.199035Z","title":"What learning algorithm is in-context learning? investigations with linear models","venue":null,"work_id":"39723056-d4c3-43bd-b085-f9a0de119f28","year":2023},"citing_paper":{"arxiv_id":"2412.16683","last_updated":"2024-12-21T16:18:59Z","snapshot_observed_at":"2026-08-21T19:46:12.835852Z","submitted_at":"2024-12-21T16:18:59Z","title":"Dynamical Behaviors of the Gradient Flows for In-Context Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T10:29:08.870216Z"},"links":{"citing_paper":"/paper/2412.16683"},"observation_digest":"sha256:1b12b0183f65f0c6c2d815180332c9f98ad5643eb763265e6c2fc311ffce9925","observation_id":"f530158b-c7ee-47ba-aceb-de293cec1201","resolution":{"observed_at":"2026-08-11T10:29:09.203012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:29:09.187886Z","title":"Max-margin token selection in attention mechanism","venue":null,"work_id":"6a15b3b5-3545-41ef-8e4c-049548237681","year":2023},"citing_paper":{"arxiv_id":"2412.16683","last_updated":"2024-12-21T16:18:59Z","snapshot_observed_at":"2026-08-21T19:46:12.835852Z","submitted_at":"2024-12-21T16:18:59Z","title":"Dynamical Behaviors of the Gradient Flows for In-Context Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T10:29:08.873995Z"},"links":{"citing_paper":"/paper/2412.16683"},"observation_digest":"sha256:c2ad1a68ce4bcc3428d12be48ebf1256352b424e723b74df53ba23368dfed700","observation_id":"f1e003a8-90f9-4d9e-b087-77484a780fac","resolution":{"observed_at":"2026-08-11T10:29:09.191650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:29:09.176429Z","title":"Training dynamics of multi-head softmax attention for in-context learning: Emer- gence, convergence, and optimality","venue":null,"work_id":"7e5290e5-edd4-4d6b-ae05-1313f4adf492","year":2024},"citing_paper":{"arxiv_id":"2412.16683","last_updated":"2024-12-21T16:18:59Z","snapshot_observed_at":"2026-08-21T19:46:12.835852Z","submitted_at":"2024-12-21T16:18:59Z","title":"Dynamical Behaviors of the Gradient Flows for In-Context Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T10:29:08.877651Z"},"links":{"citing_paper":"/paper/2412.16683"},"observation_digest":"sha256:d93a9e3eecb6bb7a0286c8a8a068bc523540d67b9b929ee5c6111f5e477e9107","observation_id":"a33852e2-9dc4-459b-a7c2-c21601778cb1","resolution":{"observed_at":"2026-08-11T10:29:09.180248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:29:09.166096Z","title":"What can transformers learn in-context? a case study of simple function classes","venue":null,"work_id":"aec16345-a8d6-4845-95dd-35486cc3e2a1","year":2022},"citing_paper":{"arxiv_id":"2412.16683","last_updated":"2024-12-21T16:18:59Z","snapshot_observed_at":"2026-08-21T19:46:12.835852Z","submitted_at":"2024-12-21T16:18:59Z","title":"Dynamical Behaviors of the Gradient Flows for In-Context Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T10:29:08.881393Z"},"links":{"citing_paper":"/paper/2412.16683"},"observation_digest":"sha256:58351601987203b501e6ba81aec8099d804361f01445e1e60393673bc5d35cfd","observation_id":"a1c52861-b25a-4c69-83a4-be706ae38d60","resolution":{"observed_at":"2026-08-11T10:29:09.169865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:29:09.155299Z","title":"Can looped transformers learn to implement multi- step gradient descent for in-context learning? InProceedings of Interna- tional Conference on Machine Learning (ICML), 2024","venue":null,"work_id":"0059c52b-da22-4fbf-ab74-b6cfe02a0fae","year":2024},"citing_paper":{"arxiv_id":"2412.16683","last_updated":"2024-12-21T16:18:59Z","snapshot_observed_at":"2026-08-21T19:46:12.835852Z","submitted_at":"2024-12-21T16:18:59Z","title":"Dynamical Behaviors of the Gradient Flows for In-Context Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T10:29:08.885099Z"},"links":{"citing_paper":"/paper/2412.16683"},"observation_digest":"sha256:d4109c42cb51a88585004b289196b1c06fa1ad8ab86942f66f28893db1000777","observation_id":"d23fe40f-3442-4c01-8e43-3d629b6a561e","resolution":{"observed_at":"2026-08-11T10:29:09.159276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06937","last_updated":"2024-05-18T03:53:15Z","snapshot_observed_at":"2026-08-16T14:35:39.569782Z","submitted_at":"2023-12-12T02:13:50Z","title":"Can a Transformer Represent a Kalman Filter?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06937","snapshot_observed_at":"2026-08-11T10:29:08.889049Z","title":"Can a transformer represent a kalman filter? arXiv preprint arXiv:2312.06937, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16683","last_updated":"2024-12-21T16:18:59Z","snapshot_observed_at":"2026-08-21T19:46:12.835852Z","submitted_at":"2024-12-21T16:18:59Z","title":"Dynamical Behaviors of the Gradient Flows for In-Context Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T10:29:08.889049Z"},"links":{"cited_paper":"/paper/2312.06937","citing_paper":"/paper/2412.16683"},"observation_digest":"sha256:f0e582b3d6159af74af813845cc8522706d38a30b6d873ab356da6aa630ec59d","observation_id":"12d6e7c0-92fa-44d6-a809-fb768a57900b","resolution":{"observed_at":"2026-08-11T10:29:08.889049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:29:09.144688Z","title":"In-context convergence of transformers","venue":null,"work_id":"833431a2-c098-4287-9b46-befd8d103fba","year":2024},"citing_paper":{"arxiv_id":"2412.16683","last_updated":"2024-12-21T16:18:59Z","snapshot_observed_at":"2026-08-21T19:46:12.835852Z","submitted_at":"2024-12-21T16:18:59Z","title":"Dynamical Behaviors of the Gradient Flows for In-Context Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T10:29:08.892951Z"},"links":{"citing_paper":"/paper/2412.16683"},"observation_digest":"sha256:38edfc3eddf325f12b4aa9ff2bb9b771d80926d94fe3bd094e2418f19ae4a796","observation_id":"d0b4e135-4e95-4121-a6b3-617901f31900","resolution":{"observed_at":"2026-08-11T10:29:09.148137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:29:08.896463Z","title":"On a formula for the product-moment coefficient of any order of a normal frequency distribution in any number of variables","venue":null,"work_id":null,"year":1918},"citing_paper":{"arxiv_id":"2412.16683","last_updated":"2024-12-21T16:18:59Z","snapshot_observed_at":"2026-08-21T19:46:12.835852Z","submitted_at":"2024-12-21T16:18:59Z","title":"Dynamical Behaviors of the Gradient Flows for In-Context Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T10:29:08.896463Z"},"links":{"citing_paper":"/paper/2412.16683"},"observation_digest":"sha256:a1a1fbd57350a23399df57ce62e899faa1419c4a39eae08710feab787bbcf4b8","observation_id":"c0c77310-202c-49c0-a402-5ba810ee0be9","resolution":{"observed_at":"2026-08-11T10:29:08.896463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:29:09.128004Z","title":"Transformers learn nonlinear features in context: Nonconvex mean-field dynamics on the attention landscape","venue":null,"work_id":"6a446234-cdd7-4b05-a61a-cbd4812c38dc","year":2024},"citing_paper":{"arxiv_id":"2412.16683","last_updated":"2024-12-21T16:18:59Z","snapshot_observed_at":"2026-08-21T19:46:12.835852Z","submitted_at":"2024-12-21T16:18:59Z","title":"Dynamical Behaviors of the Gradient Flows for In-Context Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T10:29:08.899941Z"},"links":{"citing_paper":"/paper/2412.16683"},"observation_digest":"sha256:9bd18cdb49987fb5085d0f5886082e91487aac1df98b4714d5f633968ecd840d","observation_id":"f8c51a1e-141d-4efe-b1fd-6ccac766a62a","resolution":{"observed_at":"2026-08-11T10:29:09.131879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02329","last_updated":"2022-10-10T15:25:40Z","snapshot_observed_at":"2026-08-20T08:02:24.173621Z","submitted_at":"2022-04-05T16:33:44Z","title":"Can language models learn from explanations in context?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02329","snapshot_observed_at":"2026-08-11T10:29:08.903433Z","title":"Can language models learn from explanations in context?arXiv preprint arXiv:2204.02329, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16683","last_updated":"2024-12-21T16:18:59Z","snapshot_observed_at":"2026-08-21T19:46:12.835852Z","submitted_at":"2024-12-21T16:18:59Z","title":"Dynamical Behaviors of the Gradient Flows for In-Context Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T10:29:08.903433Z"},"links":{"cited_paper":"/paper/2204.02329","citing_paper":"/paper/2412.16683"},"observation_digest":"sha256:3f51a4988f5acc7d4178e210f0a7580d123583fafef8b170c14df8460bb60126","observation_id":"bd91ce87-353f-49e3-be28-11b2834cc85a","resolution":{"observed_at":"2026-08-11T10:29:08.903433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:29:09.119231Z","title":"Fine-grained analysis of in-context linear estimation: Data, architecture, and beyond","venue":null,"work_id":"43727f36-eaa4-449e-adee-10a23fd2c3bd","year":2024},"citing_paper":{"arxiv_id":"2412.16683","last_updated":"2024-12-21T16:18:59Z","snapshot_observed_at":"2026-08-21T19:46:12.835852Z","submitted_at":"2024-12-21T16:18:59Z","title":"Dynamical Behaviors of the Gradient Flows for In-Context Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T10:29:08.907010Z"},"links":{"citing_paper":"/paper/2412.16683"},"observation_digest":"sha256:2ee60411c2c7e39e21d200b6b7a761f077b37df0979bceb9f47bb48c1b8bf041","observation_id":"25215766-b489-48c2-9b4f-cce340d03c58","resolution":{"observed_at":"2026-08-11T10:29:09.122442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:29:09.109767Z","title":"One-layer transformer provably learns one-nearest neighbor in context","venue":null,"work_id":"6738aa54-4a85-4cdc-83d3-b2185f99884e","year":2024},"citing_paper":{"arxiv_id":"2412.16683","last_updated":"2024-12-21T16:18:59Z","snapshot_observed_at":"2026-08-21T19:46:12.835852Z","submitted_at":"2024-12-21T16:18:59Z","title":"Dynamical Behaviors of the Gradient Flows for In-Context Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T10:29:08.910802Z"},"links":{"citing_paper":"/paper/2412.16683"},"observation_digest":"sha256:36cc1443787ade24350b9294bcb48dd3ca5b7940ef106a00ed955e7557d9c9ed","observation_id":"f93db7ec-a125-45fb-b5ed-8500513ac5f5","resolution":{"observed_at":"2026-08-11T10:29:09.112964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:29:09.098702Z","title":"Transformers as decision makers: Provable in-context reinforcement learning via supervised pretraining","venue":null,"work_id":"8d44d76c-e7de-48d5-b63f-d00d8e492383","year":2023},"citing_paper":{"arxiv_id":"2412.16683","last_updated":"2024-12-21T16:18:59Z","snapshot_observed_at":"2026-08-21T19:46:12.835852Z","submitted_at":"2024-12-21T16:18:59Z","title":"Dynamical Behaviors of the Gradient Flows for In-Context Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T10:29:08.914203Z"},"links":{"citing_paper":"/paper/2412.16683"},"observation_digest":"sha256:3b4c48e0185a3fc9097dad2b011b1f98c2d5ed19b0246b3947bca05ebca9fa1f","observation_id":"0f9ffda9-c458-40b4-be9d-ba07528ebac1","resolution":{"observed_at":"2026-08-11T10:29:09.102441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:29:09.087943Z","title":"Almost sure convergence rates analysis and saddle avoidance of stochastic gradient methods.Journal of Machine Learning Research, 25(271):1–40, 2024","venue":null,"work_id":"d50661ed-b324-45a9-8301-e04464f230e0","year":2024},"citing_paper":{"arxiv_id":"2412.16683","last_updated":"2024-12-21T16:18:59Z","snapshot_observed_at":"2026-08-21T19:46:12.835852Z","submitted_at":"2024-12-21T16:18:59Z","title":"Dynamical Behaviors of the Gradient Flows for In-Context Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T10:29:08.917507Z"},"links":{"citing_paper":"/paper/2412.16683"},"observation_digest":"sha256:fbcc7bba38bc85289ffbff131bd65e2bf6e0f5be988f759c7701f808f551cf87","observation_id":"5b4c4d89-7a8b-4833-a8dc-9139beae2a4c","resolution":{"observed_at":"2026-08-11T10:29:09.091858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:29:09.077784Z","title":"Local to global: Learning dynamics and effect of initialization for transformers","venue":null,"work_id":"d935c242-a0c9-4152-8a3b-e1e783e08cec","year":2024},"citing_paper":{"arxiv_id":"2412.16683","last_updated":"2024-12-21T16:18:59Z","snapshot_observed_at":"2026-08-21T19:46:12.835852Z","submitted_at":"2024-12-21T16:18:59Z","title":"Dynamical Behaviors of the Gradient Flows for In-Context Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T10:29:08.920584Z"},"links":{"citing_paper":"/paper/2412.16683"},"observation_digest":"sha256:680e7b6e6eb7dadeb3fd5ad4db3f43f3c98c4daff6ff2339ea3650d6c29dc34a","observation_id":"0bbaae01-eeec-4590-9e2d-01df3308e211","resolution":{"observed_at":"2026-08-11T10:29:09.081416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:29:09.066949Z","title":"Geometric theory of dynamical systems: an introduction","venue":null,"work_id":"22b0a395-0b2e-44e9-9f56-03d2913e570a","year":2012},"citing_paper":{"arxiv_id":"2412.16683","last_updated":"2024-12-21T16:18:59Z","snapshot_observed_at":"2026-08-21T19:46:12.835852Z","submitted_at":"2024-12-21T16:18:59Z","title":"Dynamical Behaviors of the Gradient Flows for In-Context Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T10:29:08.923816Z"},"links":{"citing_paper":"/paper/2412.16683"},"observation_digest":"sha256:4fb4f8b5c74a9103088ba0e4bf528994af7ff0799676e6856c76f0803102553f","observation_id":"6c26b760-74f8-4a00-a074-62f97a24e84c","resolution":{"observed_at":"2026-08-11T10:29:09.070718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:29:09.056111Z","title":"Scan and snap: Understanding training dynamics and token composition in 1- layer transformer","venue":null,"work_id":"bc0e5597-b728-4d1b-9358-20e91588e6bf","year":2023},"citing_paper":{"arxiv_id":"2412.16683","last_updated":"2024-12-21T16:18:59Z","snapshot_observed_at":"2026-08-21T19:46:12.835852Z","submitted_at":"2024-12-21T16:18:59Z","title":"Dynamical Behaviors of the Gradient Flows for In-Context Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T10:29:08.927182Z"},"links":{"citing_paper":"/paper/2412.16683"},"observation_digest":"sha256:c381e20f2d665154cca70e9649c972ac0f871f956bdc258f67b4c54fbbe68e83","observation_id":"344d6d9e-7c66-4063-a0ec-11ea643a59c2","resolution":{"observed_at":"2026-08-11T10:29:09.059875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:29:09.045572Z","title":"JoMA: Demystifying multilayer transformers via joint dynamics of mlp and attention","venue":null,"work_id":"faf355a0-d505-4d2e-a2db-eb85e854b3b0","year":2023},"citing_paper":{"arxiv_id":"2412.16683","last_updated":"2024-12-21T16:18:59Z","snapshot_observed_at":"2026-08-21T19:46:12.835852Z","submitted_at":"2024-12-21T16:18:59Z","title":"Dynamical Behaviors of the Gradient Flows for In-Context Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T10:29:08.929828Z"},"links":{"citing_paper":"/paper/2412.16683"},"observation_digest":"sha256:b9f019347302abd66b1296ef8a5ac8674288318e8fa7d31cb358989268bc5231","observation_id":"8ae944de-929e-46ea-ae2d-5f020c3778a0","resolution":{"observed_at":"2026-08-11T10:29:09.049429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:29:09.035969Z","title":"Transformers learn in-context by gradient descents","venue":null,"work_id":"b8cd32b4-1541-42e9-8977-da2a10e111fe","year":2023},"citing_paper":{"arxiv_id":"2412.16683","last_updated":"2024-12-21T16:18:59Z","snapshot_observed_at":"2026-08-21T19:46:12.835852Z","submitted_at":"2024-12-21T16:18:59Z","title":"Dynamical Behaviors of the Gradient Flows for In-Context Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T10:29:08.932921Z"},"links":{"citing_paper":"/paper/2412.16683"},"observation_digest":"sha256:1247ded3402ecd212abdef9a4cc9ceed5c84bdece2ae0378b8c6760b00245320","observation_id":"88845b04-6836-472a-8f22-fbe1d785040c","resolution":{"observed_at":"2026-08-11T10:29:09.039328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18634","last_updated":"2024-11-18T02:42:23Z","snapshot_observed_at":"2026-08-16T13:48:25.032041Z","submitted_at":"2024-05-28T22:33:02Z","title":"A Theoretical Understanding of Self-Correction through In-context Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18634","snapshot_observed_at":"2026-08-11T10:29:08.935947Z","title":"A theoretical understanding of self-correction through in-context alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16683","last_updated":"2024-12-21T16:18:59Z","snapshot_observed_at":"2026-08-21T19:46:12.835852Z","submitted_at":"2024-12-21T16:18:59Z","title":"Dynamical Behaviors of the Gradient Flows for In-Context Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T10:29:08.935947Z"},"links":{"cited_paper":"/paper/2405.18634","citing_paper":"/paper/2412.16683"},"observation_digest":"sha256:fc77261eafd61415c430ff7cbdfd7dc74611a562b58714f152e7df31d79d6c66","observation_id":"1a960416-dcde-4ec7-81f1-3aa6aa0b7ed0","resolution":{"observed_at":"2026-08-11T10:29:08.935947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:29:09.025010Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":"f1024af4-f02f-4075-a10f-d558672cdd6b","year":2022},"citing_paper":{"arxiv_id":"2412.16683","last_updated":"2024-12-21T16:18:59Z","snapshot_observed_at":"2026-08-21T19:46:12.835852Z","submitted_at":"2024-12-21T16:18:59Z","title":"Dynamical Behaviors of the Gradient Flows for In-Context Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T10:29:08.939015Z"},"links":{"citing_paper":"/paper/2412.16683"},"observation_digest":"sha256:d2c5aa6fa7feb118537e807068b56d0c7bbe79577f96f211507a99f62cbab970","observation_id":"0cd25337-396b-4cf0-9f44-35e125a5b3b4","resolution":{"observed_at":"2026-08-11T10:29:09.029616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10147","last_updated":"2024-09-25T19:16:16Z","snapshot_observed_at":"2026-08-16T13:25:27.352799Z","submitted_at":"2024-08-19T16:47:46Z","title":"In-Context Learning with Representations: Contextual Generalization of Trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10147","snapshot_observed_at":"2026-08-11T10:29:08.941633Z","title":"In-contextlearning with representations: Contextual generalization of trained transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16683","last_updated":"2024-12-21T16:18:59Z","snapshot_observed_at":"2026-08-21T19:46:12.835852Z","submitted_at":"2024-12-21T16:18:59Z","title":"Dynamical Behaviors of the Gradient Flows for In-Context Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T10:29:08.941633Z"},"links":{"cited_paper":"/paper/2408.10147","citing_paper":"/paper/2412.16683"},"observation_digest":"sha256:f4f20b52e15b26179d03b2b22d49379ceaa3c5bd50acb27614cb44a9ffc2c7c9","observation_id":"c1bbfbcc-c122-4072-8067-61fa72e32e3e","resolution":{"observed_at":"2026-08-11T10:29:08.941633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:29:09.012055Z","title":"dX m=1 wmx(m) q NX n=1 dX i=1 dX j=1 dX k=1 (wiUjk + Zkwiwj)x(i) n x(j) n x(k) q !# =E","venue":null,"work_id":"52126f0a-8e3b-40af-b417-78b4491f410d","year":2024},"citing_paper":{"arxiv_id":"2412.16683","last_updated":"2024-12-21T16:18:59Z","snapshot_observed_at":"2026-08-21T19:46:12.835852Z","submitted_at":"2024-12-21T16:18:59Z","title":"Dynamical Behaviors of the Gradient Flows for In-Context Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T10:29:08.945338Z"},"links":{"citing_paper":"/paper/2412.16683"},"observation_digest":"sha256:bc593d4e83937a8a33afa954cc37a6af813e2afe203003cfb207cbee91a301b0","observation_id":"08c21b49-d240-4781-8599-dd19b353057e","resolution":{"observed_at":"2026-08-11T10:29:09.016909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.16683","last_updated":"2024-12-21T16:18:59Z","latest_version":1,"primary_category":"math.DS","snapshot_observed_at":"2026-08-21T19:46:12.835852Z","submitted_at":"2024-12-21T16:18:59Z","title":"Dynamical Behaviors of the Gradient Flows for In-Context Learning"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":19},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2412.16683."}