{"as_of":"2026-08-08T18:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e20eeff65e51de16c5d5a3d3e7370d588418e055bf958959cb78308b8af98194","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:11:18.777242Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.11516/citation-record","integrity":"/paper/2506.11516/integrity","json":"/paper/2506.11516/citation-record.json","paper":"/paper/2506.11516"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T04:11:08.131180Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:08.131180Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:53f45a1b42ec6bf098a5bf90cd138a7b753d6494c356588fa94f0e3ef1e470a1","observation_id":"7e20ce3a-143f-4070-9190-7ac8ec8c42c0","resolution":{"observed_at":"2026-08-07T04:11:08.131180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.616309Z","title":"What learning algorithm is in-context learning? investigations with linear models","venue":null,"work_id":"3529b2d8-febf-4b8c-bafa-84a5ea6e1625","year":2023},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:08.222395Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:b90726eede89ff9ea313e782a43aafadf9728f6227eaa249209dc6eb31d462c9","observation_id":"a49d0843-2a9a-4897-be8b-93178dd62ffa","resolution":{"observed_at":"2026-08-07T04:11:19.620847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.601069Z","title":"Transformers as statisticians: Provable in-context learning with in-context algorithm selection","venue":null,"work_id":"412646e6-f893-45a3-a075-fb18208b9d82","year":2023},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:08.317368Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:5f319cd2f5bfa36237ba6661e014ddc744d18d34bf4be5caef037ee40ea32eee","observation_id":"00d31db9-5ef9-4a33-b25a-64734179d0c3","resolution":{"observed_at":"2026-08-07T04:11:19.605567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-07T04:11:08.418055Z","title":"On the opportunities and risks of foundation models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:08.418055Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:9e1216de24e8b68384ed26566697190cfb460060d443eaa6fc092b3bcd4cbd5e","observation_id":"1b54c1af-6f68-456a-b361-3077feba179e","resolution":{"observed_at":"2026-08-07T04:11:08.418055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.586759Z","title":"Dick, Hidenori Tanaka, and Tomer Ullman","venue":null,"work_id":"c999134b-1724-4a0a-bb1e-0dab2b2489bd","year":2024},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:08.516792Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:6027322085a56a51183390d23babf7293d0c4a3026a6d2c8b776ddd2a30d06df","observation_id":"8d152ad0-29e8-485a-95ed-7f2276fbe3cf","resolution":{"observed_at":"2026-08-07T04:11:19.591332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.570904Z","title":"Rademacher and gaussian complexities: Risk bounds and structural results","venue":null,"work_id":"03826962-bdc6-4792-ae37-d6bde1dfc3ee","year":2002},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:08.617309Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:b5f1db29cc802f128b1daeb207c962251981cd10834a682aee0ed7a8e8daddfd","observation_id":"c6519246-02f4-4de4-a614-68583eb71c66","resolution":{"observed_at":"2026-08-07T04:11:19.576163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:08.686068Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:08.686068Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:ae902ebb5b5a1006a50262b21c1c334c5d3a6f9247f4a7378a38348034cd92e9","observation_id":"f1db7f6e-412e-4b5a-8ea5-81993197fd22","resolution":{"observed_at":"2026-08-07T04:11:08.686068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:08.806290Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:08.806290Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:16f242ea300830b7a92aca5d1b40b74f5847c862a564ef00add2f85bf388261c","observation_id":"29f998c3-f124-4ba8-9d44-c697db23063e","resolution":{"observed_at":"2026-08-07T04:11:08.806290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:08.915331Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:08.915331Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:37bd2829d862f4662a93ed5918eea6665d1e57dedb33a3fae4cac9f8640ec997","observation_id":"97d7db0d-b8c7-47c5-aac6-8402deebbcd6","resolution":{"observed_at":"2026-08-07T04:11:08.915331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.524981Z","title":"A survey on in-context learning","venue":null,"work_id":"84fb7180-ff0f-46ed-a8a5-2b94b9a3170d","year":2024},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:09.041338Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:262d1530f37b508fad6699b94225bc1f9e68d9bb0ec16217287b780273970b2d","observation_id":"9717daa1-7c68-4d94-9980-1f03eb836243","resolution":{"observed_at":"2026-08-07T04:11:19.529283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.510199Z","title":"In-context learning and gradient descent revisited","venue":null,"work_id":"237f30fd-2dd9-46e7-ad09-160e49d72db7","year":2024},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:09.166762Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:2f8f906c231eed7d82381c55d709c01d2304a8ceed15888c47f6ab9c9ebffa86","observation_id":"31b5ef24-ff58-4967-93d1-03b488e31361","resolution":{"observed_at":"2026-08-07T04:11:19.514584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.495524Z","title":"Why can gpt learn in-context? language models secretly perform gradient descent as meta-optimizers","venue":null,"work_id":"37afe67c-7b06-4869-b4e1-82635782a47d","year":2023},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:09.273366Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:89538b8a40be2a3d2f277c059c2639d282a086efaa7b70a6679bbf1dabd7eb8a","observation_id":"843afbf3-62a7-4b8d-a347-cf2474acb9b2","resolution":{"observed_at":"2026-08-07T04:11:19.499829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.479546Z","title":"A mathematical framework for transformer circuits","venue":null,"work_id":"3751cc2f-02a7-4314-bf98-538babf7fe3f","year":2021},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:09.410778Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:19eae342b675812f49f3255e46b0e9b54f702826b55d489ab1c6b1b36a4d04e6","observation_id":"086fecb0-8eac-4830-8bd2-3a26aca3d425","resolution":{"observed_at":"2026-08-07T04:11:19.484694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.462931Z","title":"The evolution of statistical induction heads: In-context learning markov chains","venue":null,"work_id":"26bc4719-dd9a-4a40-95ba-fcbec160c265","year":2024},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:09.608380Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:35865197787df271dabd75bb84b7349417159b32e5b6173ea23a8a4041af28eb","observation_id":"9ec82ccc-241a-4797-a208-45a42ab1e7d4","resolution":{"observed_at":"2026-08-07T04:11:19.467950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.447323Z","title":"Transformers learn to achieve second-order convergence rates for in-context linear regression","venue":null,"work_id":"46f0abb4-50e4-48e9-b437-fd0cccabe085","year":2024},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:09.739775Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:b30f3379ef8e55154ce4ee9e32a7bc90d7dc1405ba37e5c7b7beca7715278397","observation_id":"ded6a17b-2510-4fb5-a74b-9255a39c1b8c","resolution":{"observed_at":"2026-08-07T04:11:19.452107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.431084Z","title":"How do transformers learn in-context beyond simple functions? a case study on learning with representations","venue":null,"work_id":"33308b33-c658-4f68-affa-b1dabb0bff39","year":2024},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:09.893133Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:2abf919bb2278d440fab881196b3919f14a88da295c71fdd5733ea9bc6964af4","observation_id":"8a668840-8716-40c5-8304-024212eb36d5","resolution":{"observed_at":"2026-08-07T04:11:19.435960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.414834Z","title":"What can transformers learn in-context? a case study of simple function classes","venue":null,"work_id":"3d5ba8fb-d4b8-48a5-96d1-6eb32a07b0cc","year":2022},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:10.017243Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:774e5fb603e8362680e4aaa138990cb3fd04da7821b46c1d755ec414a06b26d4","observation_id":"50baad5d-2e06-4de8-beef-87736b807302","resolution":{"observed_at":"2026-08-07T04:11:19.419599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.07971","last_updated":"2023-03-14T15:24:05Z","snapshot_observed_at":"2026-08-06T13:04:22.551600Z","submitted_at":"2023-03-14T15:24:05Z","title":"A Theory of Emergent In-Context Learning as Implicit Structure Induction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.07971","snapshot_observed_at":"2026-08-07T04:11:10.128035Z","title":"A theory of emergent in-context learning as implicit structure induction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:10.128035Z"},"links":{"cited_paper":"/paper/2303.07971","citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:280d8a602a4c04c2edc1918e8b17a5fdd81b15cd0a22a95601a3b2cc25970ca8","observation_id":"bc8900d1-5e2e-406d-b2bc-3f76530dd34d","resolution":{"observed_at":"2026-08-07T04:11:10.128035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-07T04:11:10.243581Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:10.243581Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:124244b36e553a5af5c546b48112df9f2c1badd639799c15f95db5df97776aba","observation_id":"10cb7cbd-6e5d-48ad-a607-e0db0796f179","resolution":{"observed_at":"2026-08-07T04:11:10.243581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.400128Z","title":"Lee, Qi Lei, and Benjamin Van Roy","venue":null,"work_id":"12e21b75-4147-48c3-8890-abbfa93441a5","year":2024},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:10.408678Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:f2d8c073d4e378a954992ef395870dacce37859a97d9398867acc6a2c77798fd","observation_id":"a02e7793-c9c2-42b4-a639-3d29d675903a","resolution":{"observed_at":"2026-08-07T04:11:19.404830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:10.579815Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:10.579815Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:45de22bcbceef270f6e0b11cec4147237b01c012696ebd6e1face2e583c2fc8c","observation_id":"613baf00-1742-4a4a-85b3-8bcc79771a32","resolution":{"observed_at":"2026-08-07T04:11:10.579815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.373890Z","title":"Transformers as algorithms: Generalization and stability in in-context learning","venue":null,"work_id":"cdb6a249-596e-4ad8-842b-b1f0b55b1b6d","year":2023},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:10.743114Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:81edd4ffe45fe590ac546801c84b75e7dec98b3d739b26ad66eb1e91ac6b86ec","observation_id":"18283e9f-f8b6-4bb9-b6f7-a604baec642b","resolution":{"observed_at":"2026-08-07T04:11:19.378586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.359074Z","title":"The closeness of in-context learning and weight shifting for softmax regression","venue":null,"work_id":"db013df8-3dd7-46ff-8979-90577439b90d","year":2024},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:10.864607Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:97f36b67406412af6598082a7d07d6915ad759f7e547f9c67bc3b26a077b51c9","observation_id":"3775dbb8-7237-403d-8a6e-4ba87a60d2fb","resolution":{"observed_at":"2026-08-07T04:11:19.364184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.344125Z","title":"Probability in Banach Spaces: isoperimetry and processes","venue":null,"work_id":"0b308627-40c1-4df5-a0cf-35f5b3c72aa8","year":2013},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:11.006528Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:5a21f537c3bf2b59fd5e95122f3db7b3b0b422fc2c9c6fb892d7117b9bbf4402","observation_id":"56b3d146-20f0-485b-8338-1911ae6c77e7","resolution":{"observed_at":"2026-08-07T04:11:19.348816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14255","last_updated":"2025-02-20T04:42:06Z","snapshot_observed_at":"2026-08-07T18:03:02.767658Z","submitted_at":"2025-02-20T04:42:06Z","title":"Effects of Prompt Length on Domain-specific Tasks for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14255","snapshot_observed_at":"2026-08-07T04:11:11.163381Z","title":"Effects of prompt length on domain-specific tasks for large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:11.163381Z"},"links":{"cited_paper":"/paper/2502.14255","citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:7a3b6696f0ba6748659c3f2006652c43e2a85361213df009b31a45a0cf0ad04e","observation_id":"d5026bfe-4438-49f3-9ca2-c463ebfe1142","resolution":{"observed_at":"2026-08-07T04:11:11.163381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.329133Z","title":"Pre-train, prompt, and predict: A systematic survey of prompting methods in natural language processing","venue":null,"work_id":"2b6598af-d8b1-46f4-8e27-be4de808ee03","year":2023},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:11.311117Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:b6499e4e136e2033794274124650f1f3cd426c8d139e1440fccefaa58098a181","observation_id":"7d1fd9b7-a6bc-467f-9615-e5a4779f7af4","resolution":{"observed_at":"2026-08-07T04:11:19.333793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.313400Z","title":"On the method of bounded differences","venue":null,"work_id":"c9ffd70c-487b-4917-87df-8a5ba961f64b","year":1989},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:11.481238Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:b0ccb4cba980c1728e620e4a9236586cf67853042ac8aa176175e35f61113c57","observation_id":"db737180-6b4d-412b-9a68-29e23ec8a6cf","resolution":{"observed_at":"2026-08-07T04:11:19.318734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.298042Z","title":null,"venue":null,"work_id":"51bfb97c-005b-4251-9bda-130891d9ff7f","year":1909},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:11.626840Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:4a72a48986e98245f34c9af9b9ace83c2caf6d00885651084e8852d9865000cf","observation_id":"f26acf8c-d5c6-4f91-9482-3cea6d56eaf1","resolution":{"observed_at":"2026-08-07T04:11:19.302114Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.283350Z","title":null,"venue":null,"work_id":"100ced66-417a-47fa-9f6f-9031c35694a8","year":2022},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:11.782948Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:f29510a56e8bbf01db2200de37759ebdb9bd35560f0d61046914d877c7b0cd64","observation_id":"dcdd381b-5283-4b07-94ea-a5e441bd5ebf","resolution":{"observed_at":"2026-08-07T04:11:19.287685Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.268343Z","title":"Metaicl: Learning to learn in context","venue":null,"work_id":"b2fbacb7-67af-480b-94ed-982ff653e5fe","year":2022},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:11.886504Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:081340285663a43109af9c359a222e30a4966d3a723a643b2c8de5f27dcaebb8","observation_id":"fc1cf7af-27b2-4f06-b8a8-9552f9973498","resolution":{"observed_at":"2026-08-07T04:11:19.273231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-08-07T04:11:11.969219Z","title":"In-context learning and induction heads","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:11.969219Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:dfb18154c5a211820ef616ad5b01ce3d456cb94848067de9194319992cf6993f","observation_id":"5e3aefdf-c761-4550-b1d1-723b6f79222c","resolution":{"observed_at":"2026-08-07T04:11:11.969219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.253034Z","title":"In-context learning through the bayesian prism","venue":null,"work_id":"71a24d00-b7c7-47ee-9497-60ae18cc3733","year":2024},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:12.033911Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:759235053a91090fc8cceea2e7532d64367ef605093c58780cab46973a521c25","observation_id":"2ee1d2f2-cac2-4798-af12-ecafe84130c8","resolution":{"observed_at":"2026-08-07T04:11:19.257538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.237731Z","title":"Improving systematic generalization of linear transformer using normalization layers and orthogonality loss function","venue":null,"work_id":"e4bea6c2-f84b-4aa2-8097-6423206c4811","year":2024},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:12.081239Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:d3efedb3c7bf6991e0d666b8f94a9e82b859f4a86e021f85766f9c2246f61d37","observation_id":"4d46b9f6-72d3-4b0e-918e-9c65a4fc62b3","resolution":{"observed_at":"2026-08-07T04:11:19.242326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:12.152810Z","title":"Fitnets: Hints for thin deep nets","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:12.152810Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:162819825b0fc0ad8d2dd393ad204682088f5d2c5c87d0280433a139947bfe8f","observation_id":"dc621124-ab68-461c-91b9-26dd27b92c31","resolution":{"observed_at":"2026-08-07T04:11:12.152810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.212679Z","title":"Towards understanding how transformers learn in-context through a representation learning lens","venue":null,"work_id":"156198c7-a377-4b31-8866-cd9a5537a91a","year":2024},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:12.224403Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:594ed8393ae6be7963e44b078030de67a82e6137c62a26fadb8a14cb78ca6fc1","observation_id":"4d08960c-eef2-40b4-ad5b-b84126978d9a","resolution":{"observed_at":"2026-08-07T04:11:19.217028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.197840Z","title":"Prompt programming for large language models: Beyond the few-shot paradigm","venue":null,"work_id":"d6b99355-1c31-4d32-b797-62bac66954c3","year":2021},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:12.277380Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:c93d6fcc4e82393fd96226736ec0663eb92714ad15ae326638af612168c6b924","observation_id":"f660e240-ba5e-456b-9cd6-29cd68a484ec","resolution":{"observed_at":"2026-08-07T04:11:19.202620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:12.350102Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:12.350102Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:392fd11f3d3fe315751da5ce9220c035bce77433ecdfa35fe65211b968aa49cf","observation_id":"687f623c-bb9b-4200-8f89-89cd07a20e54","resolution":{"observed_at":"2026-08-07T04:11:12.350102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.169993Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":"da7bb6d9-4ef6-4321-baa6-8e93e47eec70","year":2020},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:12.434329Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:bd66f1dfd18930cda180546fe2e2a2d5dad4a7ef1513b51ecaee4ab1c5f44e7e","observation_id":"a2c8bbe2-32cc-47c8-9cae-01e823c9d24b","resolution":{"observed_at":"2026-08-07T04:11:19.175566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.153656Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":"d8dbad7d-b5fa-4871-968e-7488853a9159","year":2019},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:12.541547Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:bd55753ecd95be42526e9ee98f79f02cffda08f3033eb50b845a7cb5aaa19aca","observation_id":"d78fca5c-f2d5-4e1e-baab-5e1211e5934a","resolution":{"observed_at":"2026-08-07T04:11:19.158840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.138277Z","title":"Schema-learning and rebinding as mechanisms of in-context learning and emergence","venue":null,"work_id":"de2d1156-c01d-48f4-972c-96c11d071e3e","year":2023},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:12.631289Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:5403180ffe609905acce461be4ad6aedd857c978f36e15a45a8a2cb44c606c3e","observation_id":"08c738a3-6d9e-42ed-95b9-7a302c6372f5","resolution":{"observed_at":"2026-08-07T04:11:19.142860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.123603Z","title":"Position: Do pretrained transformers learn in-context by gradient descent? In Forty-first International Conference on Machine Learning , 2024","venue":null,"work_id":"bc15fc6a-3e04-429f-b519-eba75fd3841c","year":2024},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:12.693668Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:e83f1f133e895d95b0bab3751f253add59760f6abc27e349296c8087fe2d8a96","observation_id":"4ae758fc-6bce-428b-836e-739c637f3777","resolution":{"observed_at":"2026-08-07T04:11:19.128319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T04:11:12.792902Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:12.792902Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:5c6a5e972224a09e2329fe1ad89a52e5cde002ff16fa76c209b87dff7c6bfe83","observation_id":"d1bec487-d4ed-4971-beec-980492d94194","resolution":{"observed_at":"2026-08-07T04:11:12.792902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.108695Z","title":"Function vectors in large language models","venue":null,"work_id":"49d5d283-9b77-4097-945a-bfc826e8461b","year":2024},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:12.900360Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:ab5845832323eb036a8b6eb6e52df69dcce8d0fe5f8792cd55e406fe621f6644","observation_id":"7159fcd0-d5f8-4645-9c20-b72d19f8b0f1","resolution":{"observed_at":"2026-08-07T04:11:19.113534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.092694Z","title":"Transformers learn in-context by gradient descent","venue":null,"work_id":"36578c17-085e-4974-8cc1-8d901aaa91ba","year":2023},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:13.000680Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:0ef8684b7d82d0590fbc6f442ad34aac77bc9f42df0e501315459700abec6cc0","observation_id":"9e52977c-4f7d-4066-b8a0-e66d87a5e193","resolution":{"observed_at":"2026-08-07T04:11:19.097438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05858","last_updated":"2024-10-15T13:43:50Z","snapshot_observed_at":"2026-07-06T16:17:11.839251Z","submitted_at":"2023-09-11T22:42:50Z","title":"Uncovering mesa-optimization algorithms in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05858","snapshot_observed_at":"2026-08-07T04:11:13.097520Z","title":"Uncovering mesa-optimization algorithms in transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:13.097520Z"},"links":{"cited_paper":"/paper/2309.05858","citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:483f66a8790a128f6183075eb20183d9f41771f77bdf44afcdf48e57cd954c00","observation_id":"ff999589-2f12-448d-be26-ea9e35402d55","resolution":{"observed_at":"2026-08-07T04:11:13.097520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:13.240671Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:13.240671Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:a7b258f70dbfa7f37fd9af124ec50a0a82c729869985f9dd9f5628b3416b8e05","observation_id":"ab6248d9-c08a-4e7c-8918-f46da7599a2b","resolution":{"observed_at":"2026-08-07T04:11:13.240671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.066418Z","title":"The learnability of in-context learning","venue":null,"work_id":"ff7e9c80-d2fc-47a4-8a4e-b3f559483c44","year":2023},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:13.404809Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:739fb55fba1672c62780cac34b1a51bc5eed3a71baab6f7fad05d4cbc423b0a6","observation_id":"10db895f-5e79-44e4-9a56-0d46bd535aea","resolution":{"observed_at":"2026-08-07T04:11:19.071328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:13.532892Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:13.532892Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:050cdd5b31fd233f97b09e5a58421b0f7748c00210872f4a258f4096d41080ab","observation_id":"fdc15707-2dde-4ff0-b23d-f27581ccdcd9","resolution":{"observed_at":"2026-08-07T04:11:13.532892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.038074Z","title":"Large language models are implicitly topic models: Explaining and finding good demonstrations for in-context learning","venue":null,"work_id":"a4d8e4e2-51d1-4218-b742-21f7eaee04cc","year":2023},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:13.744840Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:9e60bdf492309d289773fe9c1a8de335110be4d3f40eefd6836d7fdeae0b1c26","observation_id":"ddc6d131-5651-481b-9555-984e5f39390b","resolution":{"observed_at":"2026-08-07T04:11:19.043900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.020584Z","title":"An explanation of in-context learning as implicit bayesian inference","venue":null,"work_id":"d2aef705-7d7c-41da-aee1-fb5ee67d419d","year":2022},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:18.714226Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:e28ba29f4d6143ac6692c2f8db25d6e14ae6e3f42b8251b3f5401bfe110daade","observation_id":"5f0b6e90-0608-43ac-ad5b-46f5c81ed461","resolution":{"observed_at":"2026-08-07T04:11:19.025769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:19.005257Z","title":"Can we edit factual knowledge by in-context learning? In The 2023 Conference on Empirical Methods in Natural Language Processing , 2023","venue":null,"work_id":"626867eb-af71-41f2-8916-a3229f8622c8","year":2023},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:18.761559Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:d4a7c8d7d584c2a234f0324ecf26731fc9a9bff20e28ce19b13d28be9578b549","observation_id":"a5004177-5489-4abf-8331-1c5b8c2f386c","resolution":{"observed_at":"2026-08-07T04:11:19.010308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:18.989847Z","title":"The mystery of in-context learning: A comprehensive survey on interpretation and analysis","venue":null,"work_id":"7fc99dce-07c9-47c1-ba21-1dcb8e606d45","year":2024},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:18.767193Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:0f81e804c1fec33c57fb876c86199aeb23575021f09aa9ccd67df16d7a6dc4bd","observation_id":"e217562a-024c-44dd-8105-99262f019864","resolution":{"observed_at":"2026-08-07T04:11:18.994479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:18.974065Z","title":"Root mean square layer normalization","venue":null,"work_id":"7de981f7-fa18-4d70-adb2-2f54d195356a","year":2019},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:18.772531Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:bd35d7573362c9d1aba7250b54a21e952e66c6d4305042d5995e05272189333c","observation_id":"e74cc311-0d99-4c4e-b3f9-11d9d39f4979","resolution":{"observed_at":"2026-08-07T04:11:18.978692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:11:18.955901Z","title":"What and how does in-context learning learn? bayesian model averaging, parameterization, and generalization","venue":null,"work_id":"a4cc0052-3f64-4678-ab26-7b2d5c480ac4","year":2025},"citing_paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T04:11:18.777242Z"},"links":{"citing_paper":"/paper/2506.11516"},"observation_digest":"sha256:c24ce4c66151896ee4bd5637342f205e7a352becee80cb17e518f420a5cc4df6","observation_id":"62cf1262-645e-45f4-8b12-931972bae5c7","resolution":{"observed_at":"2026-08-07T04:11:18.963408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.11516","last_updated":"2025-06-13T07:17:41Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T04:02:10.954366Z","submitted_at":"2025-06-13T07:17:41Z","title":"Brewing Knowledge in Context: Distillation Perspectives on In-Context Learning"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":36},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2506.11516."}