{"as_of":"2026-08-08T03:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ef5268a2584d3aebcf201245c3468fe38ac0c6906de856a0f81ca3a80d8c0a0b","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T14:50:23.244358Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T05:32:01.059706Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T05:33:58.600956Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-04T14:50:20.613083Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"cited_work":{"arxiv_id":"2509.22854","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.22854","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards generalizable implicit in-context learning with attention routing","venue":null,"work_id":"2c86b4a3-0f38-4573-9b7a-673f7f8d9840","year":2025},"citing_paper":{"arxiv_id":"2605.20730","last_updated":"2026-05-20T05:26:38Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:26:38Z","title":"Distributional Alignment as a Criterion for Designing Task Vectors in In-Context Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T05:32:01.059706Z"},"links":{"cited_paper":"/paper/2509.22854","citing_paper":"/paper/2605.20730"},"observation_digest":"sha256:ddede50b6955794fda71d1f95f64c089f41e3f112f6f04571ca01a4e3381f49b","observation_id":"966e88eb-be64-4ced-9e10-ee70b5369dd1","resolution":{"observed_at":"2026-06-03T13:05:38.627651Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.22854/citation-record","integrity":"/paper/2509.22854/integrity","json":"/paper/2509.22854/citation-record.json","paper":"/paper/2509.22854"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.19442","last_updated":"2024-06-10T17:18:07Z","snapshot_observed_at":"2026-08-07T21:58:57.595600Z","submitted_at":"2024-02-29T18:43:52Z","title":"Training Dynamics of Multi-Head Softmax Attention for In-Context Learning: Emergence, Convergence, and Optimality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19442","snapshot_observed_at":"2026-08-04T14:50:22.033438Z","title":"Training dynamics of multi-head softmax attention for in-context learning: Emergence, convergence, and optimality.arXiv preprint arXiv:2402.19442,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-04T14:50:20.613083Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:22.033438Z"},"links":{"cited_paper":"/paper/2402.19442","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:b82999dbfdfcd1342fbb836b7319830dd941609e4bdeb54810c24b6cca0756d2","observation_id":"c25d9971-bf1e-4d93-a035-a836d7cc835e","resolution":{"observed_at":"2026-08-04T14:50:22.033438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:50:23.239578Z","title":"More importantly, as the input length increases, the inference time of few-shot grows much faster than that of ICR","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-04T14:50:20.613083Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.239578Z"},"links":{"citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:4139927c697fb7c3f4689176363893736a37961bd485ec64b78bebf9de837b10","observation_id":"9af70504-b30d-4139-af1c-afc375105dad","resolution":{"observed_at":"2026-08-04T14:50:23.239578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:50:23.244358Z","title":"cross-dataset","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-04T14:50:20.613083Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.244358Z"},"links":{"citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:ec4eb86ec1a5afcab1e7a4f4ace6235351e4403630741d13366f63eb0cae98ed","observation_id":"a5af7271-d133-4aca-b2d9-32e2bec09075","resolution":{"observed_at":"2026-08-04T14:50:23.244358Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-04T14:50:22.731921Z","title":"Qi Guo, Leiyu Wang, Yidong Wang, Wei Ye, and Shikun Zhang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-04T14:50:20.613083Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:22.731921Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:8a167ebb2daa6d96e16dc1a8229c7f925c9f26a124e046e61498964e1978a285","observation_id":"82aa3593-2484-48e3-888a-c38ca0010efa","resolution":{"observed_at":"2026-08-04T14:50:22.731921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15916","last_updated":"2023-10-24T15:17:14Z","snapshot_observed_at":"2026-08-07T03:42:41.198792Z","submitted_at":"2023-10-24T15:17:14Z","title":"In-Context Learning Creates Task Vectors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15916","snapshot_observed_at":"2026-08-04T14:50:22.808650Z","title":"In-context learning creates task vectors.arXiv preprint arXiv:2310.15916,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-04T14:50:20.613083Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:22.808650Z"},"links":{"cited_paper":"/paper/2310.15916","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:c13beac9240ebea448e237b63b732cdb10cd33a8c5a7e96adaf96e41480a12f1","observation_id":"44a17e93-b972-45ac-9a3c-0beca0d9a932","resolution":{"observed_at":"2026-08-04T14:50:22.808650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16130","last_updated":"2024-04-03T16:27:31Z","snapshot_observed_at":"2026-08-08T01:23:45.628587Z","submitted_at":"2023-05-25T15:04:01Z","title":"Language Models Implement Simple Word2Vec-style Vector Arithmetic","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16130","snapshot_observed_at":"2026-08-04T14:50:23.166106Z","title":"Jack Merullo, Carsten Eickhoff, and Ellie Pavlick","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-04T14:50:20.613083Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.166106Z"},"links":{"cited_paper":"/paper/2305.16130","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:384524d0941f239633d1c750e8bf2d6339e28adaf771350d5fd6d21fc890e6ee","observation_id":"0a9b24fd-0d51-4178-8f14-e357930dbe82","resolution":{"observed_at":"2026-08-04T14:50:23.166106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.15943","last_updated":"2022-05-03T10:36:39Z","snapshot_observed_at":"2026-07-06T12:03:35.232581Z","submitted_at":"2021-10-29T17:42:08Z","title":"MetaICL: Learning to Learn In Context","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.15943","snapshot_observed_at":"2026-08-04T14:50:23.170294Z","title":"Metaicl: Learning to learn in context.arXiv preprint arXiv:2110.15943,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-04T14:50:20.613083Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.170294Z"},"links":{"cited_paper":"/paper/2110.15943","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:444e410c84a73fc9858f385a108e696a427b7863338a86f70dfd2ff19e4465d3","observation_id":"c3bce674-6557-48fd-b743-f82b92e071a9","resolution":{"observed_at":"2026-08-04T14:50:23.170294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-08-04T14:50:23.174869Z","title":"Catherine Olsson, Nelson Elhage, Neel Nanda, Nicholas Joseph, Nova DasSarma, Tom Henighan, Ben Mann, Amanda Askell, Yuntao Bai, Anna Chen, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-04T14:50:20.613083Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.174869Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:1ca808a540feaee567fecff12f70d81a55e6cd636f46e068e2af399dc22d850d","observation_id":"f400c71f-1e22-4677-8f4e-747d308f8f76","resolution":{"observed_at":"2026-08-04T14:50:23.174869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:50:23.184071Z","title":"doi: 10.3115/1219840.1219855","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-04T14:50:20.613083Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.184071Z"},"links":{"citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:5676fc05e766d0debbd3d7cc69462029b06369f30283e0bc9a3286e6073853d5","observation_id":"4a7fe9d9-a096-4e72-9fd2-9f96448617ae","resolution":{"observed_at":"2026-08-04T14:50:23.184071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-04T14:50:23.192290Z","title":"Johannes V on Oswald, Eyvind Niklasson, Ettore Randazzo, Jo ˜ao Sacramento, Alexander Mordv- intsev, Andrey Zhmoginov, and Max Vladymyrov","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-04T14:50:20.613083Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.192290Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:ad98a8e29b0a039414eef5b2b9ebcbdaf628c667a4aa331635b3a9b132f12344","observation_id":"994a7e63-778f-4647-b355-323f51efd39b","resolution":{"observed_at":"2026-08-04T14:50:23.192290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09343","last_updated":"2025-02-26T06:41:43Z","snapshot_observed_at":"2026-08-04T02:40:31.949168Z","submitted_at":"2024-10-12T03:19:06Z","title":"ELICIT: LLM Augmentation via External In-Context Capability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09343","snapshot_observed_at":"2026-08-04T14:50:23.196943Z","title":"Elicit: Llm augmentation via external in- context capability.arXiv preprint arXiv:2410.09343, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-04T14:50:20.613083Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.196943Z"},"links":{"cited_paper":"/paper/2410.09343","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:ca06e713e7cdf91cc0fdd5253cca57dfacaa82791b48d872d48e003885d21904","observation_id":"05319dbf-edd4-4a00-a543-cd34d99d4e15","resolution":{"observed_at":"2026-08-04T14:50:23.196943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10375","last_updated":"2023-05-03T14:43:50Z","snapshot_observed_at":"2026-07-06T14:33:03.656499Z","submitted_at":"2022-12-20T15:55:21Z","title":"Self-Adaptive In-Context Learning: An Information Compression Perspective for In-Context Example Selection and Ordering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10375","snapshot_observed_at":"2026-08-04T14:50:23.201430Z","title":"Self-adaptive in-context learning: An information compression perspective for in-context example selection and ordering.arXiv preprint arXiv:2212.10375,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-04T14:50:20.613083Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.201430Z"},"links":{"cited_paper":"/paper/2212.10375","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:7e372efc651819edfdcaaef1b4cad43cb40e576fd7f46db11bfd7709eea560ab","observation_id":"bc499890-326d-4133-bc1a-28337bec954b","resolution":{"observed_at":"2026-08-04T14:50:23.201430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15637","last_updated":"2024-06-06T12:01:09Z","snapshot_observed_at":"2026-07-06T17:34:49.001670Z","submitted_at":"2024-02-23T22:39:12Z","title":"Addressing Order Sensitivity of In-Context Demonstration Examples in Causal Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15637","snapshot_observed_at":"2026-08-04T14:50:23.206160Z","title":"Addressing order sensitivity of in-context demonstration examples in causal language models.arXiv preprint arXiv:2402.15637,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-04T14:50:20.613083Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.206160Z"},"links":{"cited_paper":"/paper/2402.15637","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:d59e2528e1d8263d2015b4f31c8d58120cdbefe53b93cd165fbd7e37b9da8593","observation_id":"d09bab47-963e-40f8-9968-d96c6e3338be","resolution":{"observed_at":"2026-08-04T14:50:23.206160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02080","last_updated":"2022-07-21T07:44:13Z","snapshot_observed_at":"2026-07-30T03:45:35.558793Z","submitted_at":"2021-11-03T09:12:33Z","title":"An Explanation of In-context Learning as Implicit Bayesian Inference","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02080","snapshot_observed_at":"2026-08-04T14:50:23.211091Z","title":"An explanation of in-context learning as implicit bayesian inference.arXiv preprint arXiv:2111.02080,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-04T14:50:20.613083Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.211091Z"},"links":{"cited_paper":"/paper/2111.02080","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:bb6289601f04e71b63266ebff4f7cf9ffcf6cee7c8a163b4be6eb22a58291e38","observation_id":"4cd13016-bd0e-4f67-9b63-926595056edc","resolution":{"observed_at":"2026-08-04T14:50:23.211091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00871","last_updated":"2023-11-01T21:41:08Z","snapshot_observed_at":"2026-07-06T16:41:56.099361Z","submitted_at":"2023-11-01T21:41:08Z","title":"Pretraining Data Mixtures Enable Narrow Model Selection Capabilities in Transformer Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00871","snapshot_observed_at":"2026-08-04T14:50:23.215388Z","title":"Pretraining data mixtures enable narrow model selection capabilities in transformer models.arXiv preprint arXiv:2311.00871,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-04T14:50:20.613083Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.215388Z"},"links":{"cited_paper":"/paper/2311.00871","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:6c187ba3551de53654280c7676af389f210b7063ffe8b0d745d2558c19f44dad","observation_id":"6d911264-1561-445f-a98e-36f6d29df409","resolution":{"observed_at":"2026-08-04T14:50:23.215388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-04T14:50:23.219645Z","title":"Kayo Yin and Jacob Steinhardt","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-04T14:50:20.613083Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.219645Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:bb3c984730601f2f3971c6ddddfda0385b06021f97f0be435f5b031d4d782442","observation_id":"9d9ffb5d-df01-4b9c-b496-f5e54429b280","resolution":{"observed_at":"2026-08-04T14:50:23.219645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:50:23.224062Z","title":null,"venue":null,"work_id":null,"year":1970},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-04T14:50:20.613083Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.224062Z"},"links":{"citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:9918eed455ad9c7624c4315a217d1bf4bb04e0eaa67de324263f0ffd40fc35ee","observation_id":"d4b2d54c-1f05-4460-88aa-b56786235d86","resolution":{"observed_at":"2026-08-04T14:50:23.224062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:50:23.229151Z","title":"An identical argument applies toU k","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-04T14:50:20.613083Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.229151Z"},"links":{"citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:0af8d79d4783f6c7afd38b98586f831aefc72221fa415f14336b28665830fbfd","observation_id":"b7157842-139f-4c28-8750-e890e6040551","resolution":{"observed_at":"2026-08-04T14:50:23.229151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:50:23.234829Z","title":"For training, we use the same number of few-shot examples as those contained in an ICL prompt during the construction of ICL bases, drawn from five in-domain datasets","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-04T14:50:20.613083Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.234829Z"},"links":{"citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:8b6de3c9141bca802bbf5dbb4060f33486b38bda0cb7ff28dbab45ed34bd608c","observation_id":"ca6c0cdf-c5b0-45e4-9c7a-f855583512b4","resolution":{"observed_at":"2026-08-04T14:50:23.234829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:50:22.552599Z","title":"URLhttps://doi.org/10","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-04T14:50:20.613083Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":1970,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:22.552599Z"},"links":{"citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:76d37ab6a34d924d427221eb54a361e741af358cceb113141a04444235ab0531","observation_id":"783df9d7-7fa4-4631-b747-30e336762a43","resolution":{"observed_at":"2026-08-04T14:50:22.552599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08049","last_updated":"2024-04-02T01:54:53Z","snapshot_observed_at":"2026-08-07T23:27:59.441218Z","submitted_at":"2023-10-12T05:43:06Z","title":"Is attention required for ICL? Exploring the Relationship Between Model Architecture and In-Context Learning Ability","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08049","snapshot_observed_at":"2026-08-04T14:50:23.031609Z","title":"Is attention required for icl? exploring the relationship between model architecture and in-context learning ability.arXiv preprint arXiv:2310.08049,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-04T14:50:20.613083Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":2001,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.031609Z"},"links":{"cited_paper":"/paper/2310.08049","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:72e05f71eb6ba05b4403a2244a280e746ffac12a670e922ed9e4b0c106f8ff2f","observation_id":"add3b2d0-56e7-4ae6-9388-8f9344101000","resolution":{"observed_at":"2026-08-04T14:50:23.031609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:50:23.156936Z","title":"M2iv: Towards efficient and fine-grained multimodal in-context learning via representation engineering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-04T14:50:20.613083Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.156936Z"},"links":{"citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:1dc0ef95629262c59a7840b2be76fbb35f15cd7000c22fd131e0b1117eee5f06","observation_id":"cba2eb2f-9aa9-493e-b8e0-c66fbeda1485","resolution":{"observed_at":"2026-08-04T14:50:23.156936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00234","last_updated":"2024-10-05T11:47:02Z","snapshot_observed_at":"2026-07-06T14:36:25.690733Z","submitted_at":"2022-12-31T15:57:09Z","title":"A Survey on In-context Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00234","snapshot_observed_at":"2026-08-04T14:50:22.627647Z","title":"A survey on in-context learning.arXiv preprint arXiv:2301.00234,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-04T14:50:20.613083Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":2005,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:22.627647Z"},"links":{"cited_paper":"/paper/2301.00234","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:afc60b96526eef669f971534619bf1163254e87b52f6bf12e48370328f1c381c","observation_id":"32e6b99f-c986-4658-a64f-414c0e48b27f","resolution":{"observed_at":"2026-08-04T14:50:22.627647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10559","last_updated":"2023-05-15T11:45:12Z","snapshot_observed_at":"2026-08-04T19:53:52.631474Z","submitted_at":"2022-12-20T18:58:48Z","title":"Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10559","snapshot_observed_at":"2026-08-04T14:50:22.436932Z","title":"Why can gpt learn in-context? language models implicitly perform gradient descent as meta-optimizers.arXiv preprint arXiv:2212.10559,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-04T14:50:20.613083Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:22.436932Z"},"links":{"cited_paper":"/paper/2212.10559","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:ec2fde018ae8f0634fc76605d5ed0e6bcee8e28d8a9677d70a9d23a17de6cbeb","observation_id":"ba35a10a-481a-42e2-9508-fdf5e60b80a3","resolution":{"observed_at":"2026-08-04T14:50:22.436932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15213","last_updated":"2024-02-25T18:32:18Z","snapshot_observed_at":"2026-08-08T01:23:24.701475Z","submitted_at":"2023-10-23T17:55:24Z","title":"Function Vectors in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15213","snapshot_observed_at":"2026-08-04T14:50:23.187923Z","title":"Function vectors in large language models.arXiv preprint arXiv:2310.15213,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-04T14:50:20.613083Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.187923Z"},"links":{"cited_paper":"/paper/2310.15213","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:883139a1e3c7b5bb0b348928374951ec263b2a12e4ececa96f719f9f22eeda23","observation_id":"16181b88-35f6-415c-9a9e-ef0583fae94f","resolution":{"observed_at":"2026-08-04T14:50:23.187923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:50:21.969963Z","title":"Language models are few-shot learners.Advances in neural information processing systems, 33:1877–1901,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-04T14:50:20.613083Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:21.969963Z"},"links":{"citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:aabb74ee3d32a4a79ab23bb5f8b3f73b05b187c4f65035e6af19f054917ad3b6","observation_id":"3b1a1d2a-a493-4ba9-9c45-de2bea18e80b","resolution":{"observed_at":"2026-08-04T14:50:21.969963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06668","last_updated":"2024-02-13T22:37:39Z","snapshot_observed_at":"2026-07-06T16:46:06.801011Z","submitted_at":"2023-11-11T21:19:44Z","title":"In-context Vectors: Making In Context Learning More Effective and Controllable Through Latent Space Steering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.06668","snapshot_observed_at":"2026-08-04T14:50:23.161687Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-04T14:50:20.613083Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.161687Z"},"links":{"cited_paper":"/paper/2311.06668","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:6e916f8dfb3483ac085f634e53c474e53c01f37c6e32d880806ad98b0c3e0163","observation_id":"52ee78c3-2997-409b-9924-78f6d5982f6c","resolution":{"observed_at":"2026-08-04T14:50:23.161687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01653","last_updated":"2021-09-03T17:56:40Z","snapshot_observed_at":"2026-08-04T08:05:07.544242Z","submitted_at":"2021-09-03T17:56:40Z","title":"CREAK: A Dataset for Commonsense Reasoning over Entity Knowledge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01653","snapshot_observed_at":"2026-08-04T14:50:23.179507Z","title":"Creak: A dataset for common- sense reasoning over entity knowledge.arXiv preprint arXiv:2109.01653,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-04T14:50:20.613083Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:23.179507Z"},"links":{"cited_paper":"/paper/2109.01653","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:65cf595cba5dcd9ee0c915842a6c61dc351a8904588866ae13d7d99109f6ea9b","observation_id":"092222b2-7b0b-421f-86fc-33828e0c044d","resolution":{"observed_at":"2026-08-04T14:50:23.179507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-04T14:50:22.913368Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-04T14:50:20.613083Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:22.913368Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:010d35fab04ae88eda743f9ca5fa564f65c4e6dd117ab581f5ca44420a5ef93a","observation_id":"a5a7667d-935e-4e89-9372-e419cd2f311a","resolution":{"observed_at":"2026-08-04T14:50:22.913368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07661","last_updated":"2024-01-27T08:07:34Z","snapshot_observed_at":"2026-07-06T13:52:51.358104Z","submitted_at":"2022-09-16T00:52:34Z","title":"On the Relation between Sensitivity and Accuracy in In-context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07661","snapshot_observed_at":"2026-08-04T14:50:22.163974Z","title":"On the relation between sensitivity and accuracy in in-context learning.arXiv preprint arXiv:2209.07661,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-04T14:50:20.613083Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:22.163974Z"},"links":{"cited_paper":"/paper/2209.07661","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:8a94b0e793c802e0f33e7a10e8c51505bb78bb15cb488b81f5b5c14ee3ead473","observation_id":"c7acb8e5-97fb-4cb9-93c2-2060b522dffa","resolution":{"observed_at":"2026-08-04T14:50:22.163974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-04T14:50:22.311948Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","snapshot_observed_at":"2026-08-04T14:50:20.613083Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T14:50:22.311948Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2509.22854"},"observation_digest":"sha256:3694ab45753741af1a23e7f44592bdba27bc2940566ce09e8d775b460455444d","observation_id":"096fbc21-f5ac-4cd6-bbd0-3a79b1fb0c85","resolution":{"observed_at":"2026-08-04T14:50:22.311948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.22854","last_updated":"2026-06-02T17:52:26Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-04T14:50:20.613083Z","submitted_at":"2025-09-26T19:05:45Z","title":"Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 1 inbound Pith citation observation for arXiv:2509.22854."}