{"as_of":"2026-08-08T12:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ce34b8c36dd628fb8e13b20494909dee8e915e0c476f052c107e0c6b1cd43bae","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":30,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T20:21:58.250300Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":25,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2212.10559","last_updated":"2023-05-15T11:45:12Z","snapshot_observed_at":"2026-08-04T19:53:52.631474Z","submitted_at":"2022-12-20T18:58:48Z","title":"Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers","version":3},"cited_work":{"arxiv_id":"2212.10559","doi":"10.48550/arxiv.2212.10559","metadata_source":"arxiv_reference","pith_arxiv_id":"2212.10559","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Why can gpt learn in-context? language models implicitly perform gradient descent as meta-optimizers","venue":"arXiv (Cornell University)","work_id":"91525fd5-2f01-4e81-8286-7afad1afc0ca","year":2022},"citing_paper":{"arxiv_id":"2303.17491","last_updated":"2023-11-16T20:15:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-30T16:01:52Z","title":"Language Models can Solve Computer Tasks","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-17T12:17:26.602361Z"},"links":{"cited_paper":"/paper/2212.10559","citing_paper":"/paper/2303.17491"},"observation_digest":"sha256:4c8c1cfee00e1e491e6cf58b03faa1403d928b733f96dc4d8b52ab8314fb84f6","observation_id":"50dbbee2-35d4-437d-9146-bec7b25b55bf","resolution":{"observed_at":"2026-05-17T12:17:26.697618Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10559","last_updated":"2023-05-15T11:45:12Z","snapshot_observed_at":"2026-08-04T19:53:52.631474Z","submitted_at":"2022-12-20T18:58:48Z","title":"Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers","version":3},"cited_work":{"arxiv_id":"2212.10559","doi":"10.48550/arxiv.2212.10559","metadata_source":"arxiv_reference","pith_arxiv_id":"2212.10559","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Why can gpt learn in-context? language models implicitly perform gradient descent as meta-optimizers","venue":"arXiv (Cornell University)","work_id":"91525fd5-2f01-4e81-8286-7afad1afc0ca","year":2022},"citing_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-10T22:46:39.268353Z"},"links":{"cited_paper":"/paper/2212.10559","citing_paper":"/paper/2303.18223"},"observation_digest":"sha256:7a17d51b3ac6cd834098ddcef7ab2a914515b78701d177dbdcd58b192de86f88","observation_id":"63fd8123-6f64-4735-bd67-d11d758eb59e","resolution":{"observed_at":"2026-05-10T22:46:40.660977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10559","last_updated":"2023-05-15T11:45:12Z","snapshot_observed_at":"2026-08-04T19:53:52.631474Z","submitted_at":"2022-12-20T18:58:48Z","title":"Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers","version":3},"cited_work":{"arxiv_id":"2212.10559","doi":"10.48550/arxiv.2212.10559","metadata_source":"arxiv_reference","pith_arxiv_id":"2212.10559","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Why can gpt learn in-context? language models implicitly perform gradient descent as meta-optimizers","venue":"arXiv (Cornell University)","work_id":"91525fd5-2f01-4e81-8286-7afad1afc0ca","year":2022},"citing_paper":{"arxiv_id":"2305.03726","last_updated":"2025-07-28T05:33:36Z","snapshot_observed_at":"2026-07-06T15:23:52.761222Z","submitted_at":"2023-05-05T17:59:46Z","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T02:43:47.775691Z"},"links":{"cited_paper":"/paper/2212.10559","citing_paper":"/paper/2305.03726"},"observation_digest":"sha256:e5d68bb3bb6ab9453592dd20f3e2501e707dd2dea979341a54114c028ddf626e","observation_id":"15ae8f89-7997-4cf9-9e3c-183d48dbacd2","resolution":{"observed_at":"2026-05-15T02:43:47.829878Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10559","last_updated":"2023-05-15T11:45:12Z","snapshot_observed_at":"2026-08-04T19:53:52.631474Z","submitted_at":"2022-12-20T18:58:48Z","title":"Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers","version":3},"cited_work":{"arxiv_id":"2212.10559","doi":"10.48550/arxiv.2212.10559","metadata_source":"arxiv_reference","pith_arxiv_id":"2212.10559","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Why can gpt learn in-context? language models implicitly perform gradient descent as meta-optimizers","venue":"arXiv (Cornell University)","work_id":"91525fd5-2f01-4e81-8286-7afad1afc0ca","year":2022},"citing_paper":{"arxiv_id":"2309.16797","last_updated":"2023-09-28T19:01:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T19:01:07Z","title":"Promptbreeder: Self-Referential Self-Improvement Via Prompt Evolution","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-16T08:12:30.984870Z"},"links":{"cited_paper":"/paper/2212.10559","citing_paper":"/paper/2309.16797"},"observation_digest":"sha256:fc8087747858432489879e657e6d29893fc1f21c98ee04a8cce1f23624c3a394","observation_id":"5a6b0803-177a-4485-a7ac-de0eda355bb2","resolution":{"observed_at":"2026-05-16T08:12:31.422912Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10559","last_updated":"2023-05-15T11:45:12Z","snapshot_observed_at":"2026-08-04T19:53:52.631474Z","submitted_at":"2022-12-20T18:58:48Z","title":"Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers","version":3},"cited_work":{"arxiv_id":"2212.10559","doi":"10.48550/arxiv.2212.10559","metadata_source":"arxiv_reference","pith_arxiv_id":"2212.10559","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Why can gpt learn in-context? language models implicitly perform gradient descent as meta-optimizers","venue":"arXiv (Cornell University)","work_id":"91525fd5-2f01-4e81-8286-7afad1afc0ca","year":2022},"citing_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T23:26:06.183574Z"},"links":{"cited_paper":"/paper/2212.10559","citing_paper":"/paper/2309.17421"},"observation_digest":"sha256:90315e9f87164f4ff69ced688e43bc39acc53827a81868bc33f3d381d79c6759","observation_id":"c806e01e-2fba-43c1-bed1-771b9d5298b4","resolution":{"observed_at":"2026-05-15T23:26:06.309911Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10559","last_updated":"2023-05-15T11:45:12Z","snapshot_observed_at":"2026-08-04T19:53:52.631474Z","submitted_at":"2022-12-20T18:58:48Z","title":"Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10559","snapshot_observed_at":"2026-08-07T20:21:58.250300Z","title":"Why can GPT learn in-context? Language models implicitly perform gradient descent as meta-optimizers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09844","last_updated":"2025-05-28T00:52:33Z","snapshot_observed_at":"2026-08-07T20:15:30.842578Z","submitted_at":"2025-02-14T01:06:15Z","title":"Solving Empirical Bayes via Transformers","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T20:21:58.250300Z"},"links":{"cited_paper":"/paper/2212.10559","citing_paper":"/paper/2502.09844"},"observation_digest":"sha256:fed42c3cd40f8e4b7ae45ce8c7d84a7bd81055994e23827a96e0cd083300a244","observation_id":"3da142e9-65e9-47e2-99e6-72d879ce859f","resolution":{"observed_at":"2026-08-07T20:21:58.250300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10559","last_updated":"2023-05-15T11:45:12Z","snapshot_observed_at":"2026-08-04T19:53:52.631474Z","submitted_at":"2022-12-20T18:58:48Z","title":"Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers","version":3},"cited_work":{"arxiv_id":"2212.10559","doi":"10.48550/arxiv.2212.10559","metadata_source":"arxiv_reference","pith_arxiv_id":"2212.10559","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Why can gpt learn in-context? language models implicitly perform gradient descent as meta-optimizers","venue":"arXiv (Cornell University)","work_id":"91525fd5-2f01-4e81-8286-7afad1afc0ca","year":2022},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":112,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2212.10559","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:5800bf2abac07e5fdf3b84e319f5c056ac2fc40aa4b63153a07d1b6e377a62e8","observation_id":"1b2c741d-5e3f-4b31-8fc0-a82672e51db4","resolution":{"observed_at":"2026-05-19T08:02:24.005948Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10559","last_updated":"2023-05-15T11:45:12Z","snapshot_observed_at":"2026-08-04T19:53:52.631474Z","submitted_at":"2022-12-20T18:58:48Z","title":"Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10559","snapshot_observed_at":"2026-08-07T14:34:10.101025Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18485","last_updated":"2025-05-24T03:19:36Z","snapshot_observed_at":"2026-08-07T14:28:31.571182Z","submitted_at":"2025-05-24T03:19:36Z","title":"The Prompt is Mightier than the Example","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:10.101025Z"},"links":{"cited_paper":"/paper/2212.10559","citing_paper":"/paper/2505.18485"},"observation_digest":"sha256:285717b10efab27c614dd327d7a63eb9bece6293209c521bb12ff4ac7e748017","observation_id":"f2a18f1c-ddf2-4360-96b5-16cbb6868900","resolution":{"observed_at":"2026-08-07T14:34:10.101025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10559","last_updated":"2023-05-15T11:45:12Z","snapshot_observed_at":"2026-08-04T19:53:52.631474Z","submitted_at":"2022-12-20T18:58:48Z","title":"Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10559","snapshot_observed_at":"2026-08-07T14:24:28.780094Z","title":"Why can gpt learn in-context? language models implicitly perform gradient descent as meta-optimizers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19107","last_updated":"2025-05-25T11:54:23Z","snapshot_observed_at":"2026-08-07T14:18:01.516567Z","submitted_at":"2025-05-25T11:54:23Z","title":"Optimization-Inspired Few-Shot Adaptation for Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:28.780094Z"},"links":{"cited_paper":"/paper/2212.10559","citing_paper":"/paper/2505.19107"},"observation_digest":"sha256:e0cd685c9dfaf3441e07743887f80c205eb76dba409d41778874fbba6f613e3e","observation_id":"3b5f9650-bca0-4ed6-b0b5-4582b762fb54","resolution":{"observed_at":"2026-08-07T14:24:28.780094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10559","last_updated":"2023-05-15T11:45:12Z","snapshot_observed_at":"2026-08-04T19:53:52.631474Z","submitted_at":"2022-12-20T18:58:48Z","title":"Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10559","snapshot_observed_at":"2026-08-07T11:40:35.806691Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T22:04:35.171751Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:35.806691Z"},"links":{"cited_paper":"/paper/2212.10559","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:4e0acd4bc93ecf4473aee4be020be884fa0d8e3c20c270fe6c12746ecdb2965e","observation_id":"37303a8d-8c66-443b-b845-98f7ab01a44b","resolution":{"observed_at":"2026-08-07T11:40:35.806691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10559","last_updated":"2023-05-15T11:45:12Z","snapshot_observed_at":"2026-08-04T19:53:52.631474Z","submitted_at":"2022-12-20T18:58:48Z","title":"Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10559","snapshot_observed_at":"2026-08-07T11:13:00.986510Z","title":"Why can gpt learn in-context? language models implicitly perform gradient descent as meta-optimizers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03426","last_updated":"2025-06-03T22:12:28Z","snapshot_observed_at":"2026-08-07T11:23:57.809271Z","submitted_at":"2025-06-03T22:12:28Z","title":"Adaptive Task Vectors for Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:13:00.986510Z"},"links":{"cited_paper":"/paper/2212.10559","citing_paper":"/paper/2506.03426"},"observation_digest":"sha256:ac5e0e3201953f901dd65c61fe6a472f8f2db7ad417c133e7c347b08ec93be16","observation_id":"a3cea4c2-1328-4005-bd43-bd54952659da","resolution":{"observed_at":"2026-08-07T11:13:00.986510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10559","last_updated":"2023-05-15T11:45:12Z","snapshot_observed_at":"2026-08-04T19:53:52.631474Z","submitted_at":"2022-12-20T18:58:48Z","title":"Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10559","snapshot_observed_at":"2026-08-07T11:01:08.177043Z","title":"Why can gpt learn in-context? language models implicitly perform gradient descent as meta-optimizers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03799","last_updated":"2025-06-04T10:06:32Z","snapshot_observed_at":"2026-08-07T23:38:53.285206Z","submitted_at":"2025-06-04T10:06:32Z","title":"ConText: Driving In-context Learning for Text Removal and Segmentation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T11:01:08.177043Z"},"links":{"cited_paper":"/paper/2212.10559","citing_paper":"/paper/2506.03799"},"observation_digest":"sha256:b2cfefa74351e8a0cbd202abc5f0585c33f0d9d8a04945bfbf220e96c4cbedbd","observation_id":"bc3b31fb-3efc-45a2-9ef0-166de5dcd8aa","resolution":{"observed_at":"2026-08-07T11:01:08.177043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10559","last_updated":"2023-05-15T11:45:12Z","snapshot_observed_at":"2026-08-04T19:53:52.631474Z","submitted_at":"2022-12-20T18:58:48Z","title":"Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10559","snapshot_observed_at":"2026-08-07T10:33:36.244991Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05200","last_updated":"2025-08-28T16:07:16Z","snapshot_observed_at":"2026-08-08T06:17:18.850826Z","submitted_at":"2025-06-05T16:12:51Z","title":"Transformers Meet In-Context Learning: A Universal Approximation Theory","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:36.244991Z"},"links":{"cited_paper":"/paper/2212.10559","citing_paper":"/paper/2506.05200"},"observation_digest":"sha256:ef0c794f07b52c975067c09130fe290be97fc08e37732ff919f6417c394d4ef2","observation_id":"f530a241-cb5d-45f9-98f0-db8dbcbee486","resolution":{"observed_at":"2026-08-07T10:33:36.244991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10559","last_updated":"2023-05-15T11:45:12Z","snapshot_observed_at":"2026-08-04T19:53:52.631474Z","submitted_at":"2022-12-20T18:58:48Z","title":"Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10559","snapshot_observed_at":"2026-08-07T05:59:02.033815Z","title":"Why can gpt learn in-context? language models implicitly perform gradient descent as meta-optimizers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06526","last_updated":"2025-06-06T20:42:39Z","snapshot_observed_at":"2026-08-07T21:53:15.588065Z","submitted_at":"2025-06-06T20:42:39Z","title":"Prompting Wireless Networks: Reinforced In-Context Learning for Power Control","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T05:59:02.033815Z"},"links":{"cited_paper":"/paper/2212.10559","citing_paper":"/paper/2506.06526"},"observation_digest":"sha256:df7b9c396e83d31eeb8b605e49e834875724461d5734eb069126c3cd8d4ab5b2","observation_id":"189287f6-70ad-4f4b-a374-df3b7489b3b9","resolution":{"observed_at":"2026-08-07T05:59:02.033815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10559","last_updated":"2023-05-15T11:45:12Z","snapshot_observed_at":"2026-08-04T19:53:52.631474Z","submitted_at":"2022-12-20T18:58:48Z","title":"Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10559","snapshot_observed_at":"2026-08-06T22:41:50.199758Z","title":"Why can gpt learn in-context? language models secretly perform gradient descent as meta-optimizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20989","last_updated":"2025-06-26T04:06:20Z","snapshot_observed_at":"2026-08-08T09:37:17.501553Z","submitted_at":"2025-06-26T04:06:20Z","title":"Can Gradient Descent Simulate Prompting?","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:50.199758Z"},"links":{"cited_paper":"/paper/2212.10559","citing_paper":"/paper/2506.20989"},"observation_digest":"sha256:6afddcedee5f546c9378030c589d68f7523b9a7ca77b53ce9da23abeb9ff7436","observation_id":"85552c65-25d6-4d33-ba2c-693c03187b7c","resolution":{"observed_at":"2026-08-06T22:41:50.199758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10559","last_updated":"2023-05-15T11:45:12Z","snapshot_observed_at":"2026-08-04T19:53:52.631474Z","submitted_at":"2022-12-20T18:58:48Z","title":"Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10559","snapshot_observed_at":"2026-08-06T21:38:16.429781Z","title":"Why can gpt learn in-context? language models secretly perform gradient descent as meta-optimizers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00092","last_updated":"2025-06-30T09:53:41Z","snapshot_observed_at":"2026-08-08T10:51:41.279421Z","submitted_at":"2025-06-30T09:53:41Z","title":"Thinking About Thinking: SAGE-nano's Inverse Reasoning for Self-Aware Language Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:16.429781Z"},"links":{"cited_paper":"/paper/2212.10559","citing_paper":"/paper/2507.00092"},"observation_digest":"sha256:16d7e7d04f03a590a51f78d8a9f282f763eba0b75c78cbbb47af20eb64afee9f","observation_id":"9e863460-63fb-42d3-b1ed-6a727aab1fb1","resolution":{"observed_at":"2026-08-06T21:38:16.429781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10559","last_updated":"2023-05-15T11:45:12Z","snapshot_observed_at":"2026-08-04T19:53:52.631474Z","submitted_at":"2022-12-20T18:58:48Z","title":"Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10559","snapshot_observed_at":"2026-08-06T17:52:35.454020Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10085","last_updated":"2025-07-14T09:11:33Z","snapshot_observed_at":"2026-08-08T11:30:55.213065Z","submitted_at":"2025-07-14T09:11:33Z","title":"Enhancing Chain-of-Thought Reasoning with Critical Representation Fine-tuning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:35.454020Z"},"links":{"cited_paper":"/paper/2212.10559","citing_paper":"/paper/2507.10085"},"observation_digest":"sha256:1bf585167cc8c058c44235e1bf8ae37f4806ed5ea37012ccfd64327f59deb1cd","observation_id":"f33f08b3-2cb9-41e1-ab57-7d174a2ed617","resolution":{"observed_at":"2026-08-06T17:52:35.454020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10559","last_updated":"2023-05-15T11:45:12Z","snapshot_observed_at":"2026-08-04T19:53:52.631474Z","submitted_at":"2022-12-20T18:58:48Z","title":"Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10559","snapshot_observed_at":"2026-08-06T16:37:02.712441Z","title":"Why can gpt learn in-context? language models implicitly perform gradient descent as meta-optimizers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13540","last_updated":"2025-07-30T01:51:41Z","snapshot_observed_at":"2026-08-07T22:00:27.833618Z","submitted_at":"2025-07-17T21:19:32Z","title":"Provable Low-Frequency Bias of In-Context Learning of Representations","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:02.712441Z"},"links":{"cited_paper":"/paper/2212.10559","citing_paper":"/paper/2507.13540"},"observation_digest":"sha256:93123309500bb0f5eeede0aaaf98c9ff932e8c2257a969c69033387d6de4d6f5","observation_id":"deca8069-da0c-437e-813b-8acbc46c6ab6","resolution":{"observed_at":"2026-08-06T16:37:02.712441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10559","last_updated":"2023-05-15T11:45:12Z","snapshot_observed_at":"2026-08-04T19:53:52.631474Z","submitted_at":"2022-12-20T18:58:48Z","title":"Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10559","snapshot_observed_at":"2026-08-06T14:49:56.605376Z","title":"Why can gpt learn in-context? language models implicitly perform gradient descent as meta-optimizers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.13162","last_updated":"2025-07-23T15:38:14Z","snapshot_observed_at":"2026-08-06T14:43:01.793241Z","submitted_at":"2025-07-23T15:38:14Z","title":"FedChip: Federated LLM for Artificial Intelligence Accelerator Chip Design","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T14:49:56.605376Z"},"links":{"cited_paper":"/paper/2212.10559","citing_paper":"/paper/2508.13162"},"observation_digest":"sha256:592bea821c65c2373b1cec08369d46036a09b3f428440a855cbb1235b93e0589","observation_id":"4416e9c6-7f19-4c47-a553-1d75d4f02152","resolution":{"observed_at":"2026-08-06T14:49:56.605376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10559","last_updated":"2023-05-15T11:45:12Z","snapshot_observed_at":"2026-08-04T19:53:52.631474Z","submitted_at":"2022-12-20T18:58:48Z","title":"Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10559","snapshot_observed_at":"2026-08-04T14:50:22.436932Z","title":"Why can gpt learn in-context? language models implicitly perform gradient descent as meta-optimizers.arXiv preprint arXiv:2212.10559,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-04T14:50:20.613083Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:22.436932Z"},"links":{"cited_paper":"/paper/2212.10559","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:ec2fde018ae8f0634fc76605d5ed0e6bcee8e28d8a9677d70a9d23a17de6cbeb","observation_id":"ba35a10a-481a-42e2-9508-fdf5e60b80a3","resolution":{"observed_at":"2026-08-04T14:50:22.436932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10559","last_updated":"2023-05-15T11:45:12Z","snapshot_observed_at":"2026-08-04T19:53:52.631474Z","submitted_at":"2022-12-20T18:58:48Z","title":"Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers","version":3},"cited_work":{"arxiv_id":"2212.10559","doi":"10.48550/arxiv.2212.10559","metadata_source":"arxiv_reference","pith_arxiv_id":"2212.10559","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Why can gpt learn in-context? language models implicitly perform gradient descent as meta-optimizers","venue":"arXiv (Cornell University)","work_id":"91525fd5-2f01-4e81-8286-7afad1afc0ca","year":2022},"citing_paper":{"arxiv_id":"2604.08537","last_updated":"2026-04-09T17:59:32Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:59:32Z","title":"Meta-learning In-Context Enables Training-Free Cross Subject Brain Decoding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T17:42:33.975433Z"},"links":{"cited_paper":"/paper/2212.10559","citing_paper":"/paper/2604.08537"},"observation_digest":"sha256:06ca3ed4f59cc036037d0090268cb0ce5872231a7718ba5f3bc303edb65df279","observation_id":"035df581-eae6-4b96-a93a-b08e5d629744","resolution":{"observed_at":"2026-05-11T06:15:58.798403Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10559","last_updated":"2023-05-15T11:45:12Z","snapshot_observed_at":"2026-08-04T19:53:52.631474Z","submitted_at":"2022-12-20T18:58:48Z","title":"Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers","version":3},"cited_work":{"arxiv_id":"2212.10559","doi":"10.48550/arxiv.2212.10559","metadata_source":"arxiv_reference","pith_arxiv_id":"2212.10559","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Why can gpt learn in-context? language models implicitly perform gradient descent as meta-optimizers","venue":"arXiv (Cornell University)","work_id":"91525fd5-2f01-4e81-8286-7afad1afc0ca","year":2022},"citing_paper":{"arxiv_id":"2604.13403","last_updated":"2026-04-15T02:12:51Z","snapshot_observed_at":"2026-07-06T23:01:23.771347Z","submitted_at":"2026-04-15T02:12:51Z","title":"Why Multimodal In-Context Learning Lags Behind? Unveiling the Inner Mechanisms and Bottlenecks","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-10T13:41:37.942145Z"},"links":{"cited_paper":"/paper/2212.10559","citing_paper":"/paper/2604.13403"},"observation_digest":"sha256:0012bb8fd7f83761fcd86cd1dac4498658188572537a0bc154e71647d37eff44","observation_id":"454ea40e-9d3f-4977-ae76-bf7186f1293e","resolution":{"observed_at":"2026-05-10T13:45:28.215723Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10559","last_updated":"2023-05-15T11:45:12Z","snapshot_observed_at":"2026-08-04T19:53:52.631474Z","submitted_at":"2022-12-20T18:58:48Z","title":"Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers","version":3},"cited_work":{"arxiv_id":"2212.10559","doi":"10.48550/arxiv.2212.10559","metadata_source":"arxiv_reference","pith_arxiv_id":"2212.10559","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Why can gpt learn in-context? language models implicitly perform gradient descent as meta-optimizers","venue":"arXiv (Cornell University)","work_id":"91525fd5-2f01-4e81-8286-7afad1afc0ca","year":2022},"citing_paper":{"arxiv_id":"2604.23371","last_updated":"2026-04-25T16:35:25Z","snapshot_observed_at":"2026-07-06T23:09:38.799345Z","submitted_at":"2026-04-25T16:35:25Z","title":"When Context Sticks: Studying Interference in In-Context Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T08:31:14.231710Z"},"links":{"cited_paper":"/paper/2212.10559","citing_paper":"/paper/2604.23371"},"observation_digest":"sha256:1c2f050e3baa09c41ec1f4bc37af2c048f6bec30c993ecc03be8d00c95964616","observation_id":"09dcf600-7f5c-4d2d-979b-a4de53e955d8","resolution":{"observed_at":"2026-05-11T20:36:09.472739Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10559","last_updated":"2023-05-15T11:45:12Z","snapshot_observed_at":"2026-08-04T19:53:52.631474Z","submitted_at":"2022-12-20T18:58:48Z","title":"Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers","version":3},"cited_work":{"arxiv_id":"2212.10559","doi":"10.48550/arxiv.2212.10559","metadata_source":"arxiv_reference","pith_arxiv_id":"2212.10559","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Why can gpt learn in-context? language models implicitly perform gradient descent as meta-optimizers","venue":"arXiv (Cornell University)","work_id":"91525fd5-2f01-4e81-8286-7afad1afc0ca","year":2022},"citing_paper":{"arxiv_id":"2605.09727","last_updated":"2026-05-10T19:52:29Z","snapshot_observed_at":"2026-07-31T17:23:23.893636Z","submitted_at":"2026-05-10T19:52:29Z","title":"One for All: A Non-Linear Transformer can Enable Cross-Domain Generalization for In-Context Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T03:46:21.786972Z"},"links":{"cited_paper":"/paper/2212.10559","citing_paper":"/paper/2605.09727"},"observation_digest":"sha256:730602d8ceae97b4553458b6f8360e84a3beaba8a2de8b6bc2dbad6660e2810f","observation_id":"9ea03faa-0a0d-4735-bbe3-5912714f6a17","resolution":{"observed_at":"2026-05-12T06:56:32.066177Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10559","last_updated":"2023-05-15T11:45:12Z","snapshot_observed_at":"2026-08-04T19:53:52.631474Z","submitted_at":"2022-12-20T18:58:48Z","title":"Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers","version":3},"cited_work":{"arxiv_id":"2212.10559","doi":"10.48550/arxiv.2212.10559","metadata_source":"arxiv_reference","pith_arxiv_id":"2212.10559","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Why can gpt learn in-context? language models implicitly perform gradient descent as meta-optimizers","venue":"arXiv (Cornell University)","work_id":"91525fd5-2f01-4e81-8286-7afad1afc0ca","year":2022},"citing_paper":{"arxiv_id":"2605.10640","last_updated":"2026-05-11T14:28:02Z","snapshot_observed_at":"2026-07-06T23:22:32.858399Z","submitted_at":"2026-05-11T14:28:02Z","title":"Towards Understanding Continual Factual Knowledge Acquisition of Language Models: From Theory to Algorithm","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-12T04:47:54.466097Z"},"links":{"cited_paper":"/paper/2212.10559","citing_paper":"/paper/2605.10640"},"observation_digest":"sha256:57eebecae3e7a08006673ce3db5c8817715782297f1c30135e85cae85c678f43","observation_id":"5d61b067-8c82-4d16-8790-406bdc1b0a09","resolution":{"observed_at":"2026-05-12T05:56:25.555016Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10559","last_updated":"2023-05-15T11:45:12Z","snapshot_observed_at":"2026-08-04T19:53:52.631474Z","submitted_at":"2022-12-20T18:58:48Z","title":"Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers","version":3},"cited_work":{"arxiv_id":"2212.10559","doi":"10.48550/arxiv.2212.10559","metadata_source":"arxiv_reference","pith_arxiv_id":"2212.10559","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Why can gpt learn in-context? language models implicitly perform gradient descent as meta-optimizers","venue":"arXiv (Cornell University)","work_id":"91525fd5-2f01-4e81-8286-7afad1afc0ca","year":2022},"citing_paper":{"arxiv_id":"2605.12412","last_updated":"2026-05-12T17:09:41Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:09:41Z","title":"Stories in Space: In-Context Learning Trajectories in Conceptual Belief Space","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-13T05:17:34.283917Z"},"links":{"cited_paper":"/paper/2212.10559","citing_paper":"/paper/2605.12412"},"observation_digest":"sha256:8ab7fdd7d9ed526483480b139e74c235a0f3384dc6b0eb94eb2a2890a0cafddf","observation_id":"884600e5-edd9-4d87-99db-7326b94408fd","resolution":{"observed_at":"2026-05-13T05:27:19.289708Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10559","last_updated":"2023-05-15T11:45:12Z","snapshot_observed_at":"2026-08-04T19:53:52.631474Z","submitted_at":"2022-12-20T18:58:48Z","title":"Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers","version":3},"cited_work":{"arxiv_id":"2212.10559","doi":"10.48550/arxiv.2212.10559","metadata_source":"arxiv_reference","pith_arxiv_id":"2212.10559","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Why can gpt learn in-context? language models implicitly perform gradient descent as meta-optimizers","venue":"arXiv (Cornell University)","work_id":"91525fd5-2f01-4e81-8286-7afad1afc0ca","year":2022},"citing_paper":{"arxiv_id":"2605.20495","last_updated":"2026-05-19T21:02:43Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T21:02:43Z","title":"A Human-in-the-Loop Framework for Efficient Prompt Selection in Microscopy Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T07:05:19.381117Z"},"links":{"cited_paper":"/paper/2212.10559","citing_paper":"/paper/2605.20495"},"observation_digest":"sha256:41181b5dcb5401cf23d861801864417a055ffe3ebfc9a17529455906b08aeead","observation_id":"52b36e7f-c9cd-4886-878b-1e1dd404afde","resolution":{"observed_at":"2026-05-21T07:09:46.436740Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10559","last_updated":"2023-05-15T11:45:12Z","snapshot_observed_at":"2026-08-04T19:53:52.631474Z","submitted_at":"2022-12-20T18:58:48Z","title":"Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers","version":3},"cited_work":{"arxiv_id":"2212.10559","doi":"10.48550/arxiv.2212.10559","metadata_source":"arxiv_reference","pith_arxiv_id":"2212.10559","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Why can gpt learn in-context? language models implicitly perform gradient descent as meta-optimizers","venue":"arXiv (Cornell University)","work_id":"91525fd5-2f01-4e81-8286-7afad1afc0ca","year":2022},"citing_paper":{"arxiv_id":"2607.01918","last_updated":"2026-07-02T09:16:51Z","snapshot_observed_at":"2026-07-07T00:07:23.664493Z","submitted_at":"2026-07-02T09:16:51Z","title":"Zeus: Towards Tuning-Free Foundation Model for Time Series Analysis","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-03T17:34:37.552706Z"},"links":{"cited_paper":"/paper/2212.10559","citing_paper":"/paper/2607.01918"},"observation_digest":"sha256:9120397ca6716b28f63271c436f5505fb9922991019bd8795ce958d6a32b7051","observation_id":"e2aac111-2d4b-43a6-b390-6a6c03f2c5a9","resolution":{"observed_at":"2026-07-03T17:38:43.288286Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10559","last_updated":"2023-05-15T11:45:12Z","snapshot_observed_at":"2026-08-04T19:53:52.631474Z","submitted_at":"2022-12-20T18:58:48Z","title":"Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10559","snapshot_observed_at":"2026-08-01T22:19:53.717359Z","title":"Why can gpt learn in- context? language models secretly perform gradient descent as meta-optimizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15819","last_updated":"2026-07-17T10:28:27Z","snapshot_observed_at":"2026-08-04T15:34:15.583312Z","submitted_at":"2026-07-17T10:28:27Z","title":"In-context learning of closed form solution to simple linear regression task using transformer with linear self-attention","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T22:19:53.717359Z"},"links":{"cited_paper":"/paper/2212.10559","citing_paper":"/paper/2607.15819"},"observation_digest":"sha256:e275abcb5d16d21a95693a4565a85b0cc9a073bfc32b9db11bb71a07cb3e042c","observation_id":"9826500b-d439-411f-a5ba-babb80ea6390","resolution":{"observed_at":"2026-08-01T22:19:53.717359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10559","last_updated":"2023-05-15T11:45:12Z","snapshot_observed_at":"2026-08-04T19:53:52.631474Z","submitted_at":"2022-12-20T18:58:48Z","title":"Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10559","snapshot_observed_at":"2026-08-01T07:28:33.862109Z","title":"arXiv preprint arXiv:2212.10559 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21453","last_updated":"2026-07-24T02:14:44Z","snapshot_observed_at":"2026-08-03T14:01:50.133228Z","submitted_at":"2026-07-23T15:55:29Z","title":"Test-Time Scaling via Error Localization","version":2},"reference_index":152,"source":"arxiv_source","source_observed_at":"2026-08-01T07:28:33.862109Z"},"links":{"cited_paper":"/paper/2212.10559","citing_paper":"/paper/2607.21453"},"observation_digest":"sha256:e256162de2971ee4cedab712e4095ecdff0865a83436faca39b4aab8ffb86afe","observation_id":"c62be06b-bd3c-4f73-b347-59328c7af37d","resolution":{"observed_at":"2026-08-01T07:28:33.862109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2212.10559/citation-record","integrity":"/paper/2212.10559/integrity","json":"/paper/2212.10559/citation-record.json","paper":"/paper/2212.10559"},"outbound":[],"paper":{"arxiv_id":"2212.10559","last_updated":"2023-05-15T11:45:12Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-04T19:53:52.631474Z","submitted_at":"2022-12-20T18:58:48Z","title":"Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 30 inbound Pith citation observations for arXiv:2212.10559."}