{"as_of":"2026-08-04T08:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2abfa097f4d3f2e6c553c1a785ad14a5f9c6caa2d633291d506d495aee143991","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-07T16:37:26.420806Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.03780/citation-record","integrity":"/paper/2605.03780/integrity","json":"/paper/2605.03780/citation-record.json","paper":"/paper/2605.03780"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Aitchison.The Statistical Analysis of Compositional Data","venue":null,"work_id":"7897757c-cf68-46e5-a82e-793f6c422b17","year":1986},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:a4eec0499e332dfbb6319edcf768c3fddbbbf5f162df19db388e055e0ccd62a9","observation_id":"5946865f-e167-4f49-a600-d0fee130acd2","resolution":{"observed_at":"2026-05-27T02:03:23.641748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What learning algorithm is in-context learning? Investigations with linear models","venue":null,"work_id":"4942cdd2-1e46-4533-9270-28ecb2e9eeb1","year":2023},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:677154cc49d4880f1c9ff86f882622d95d390eeaefb0c013e3e4f512f6892e1a","observation_id":"e8264c18-1833-4a9c-a6dd-e30605ccb3b9","resolution":{"observed_at":"2026-05-27T02:03:23.658225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards monosemanticity: Decomposing language models with dictionary learning.Transformer Circuits Thread","venue":null,"work_id":"fdbca5b8-7382-4b68-88ee-7f3b3c736dd6","year":2023},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:a0b3ad69c968bc5f2c7861928efc27b12818ebe2b7a60b154dd169d312ad8870","observation_id":"b20da21c-77da-462c-8621-de9d99fc4dd6","resolution":{"observed_at":"2026-05-27T02:03:23.662383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:57:25.332055Z","title":"Language models are few-shot learners.Advances in neural information processing systems, 33:1877–1901","venue":null,"work_id":"bd7ec542-9242-446e-955e-bb75e729be5d","year":1901},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:3cb0ac2d2568caaa44c95b6f9d04eaed4afc871640e2627ce9256899d243f927","observation_id":"bda420c7-81ac-4997-9280-42ed0aed7bdd","resolution":{"observed_at":"2026-05-27T02:03:23.634026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust uncertainty principles: Exact signal reconstruction from highly incomplete frequency information.IEEE Transactions on information theory, 52(2):489–509","venue":null,"work_id":"27fa4073-6b43-4ccb-8efd-973e94e338e0","year":2006},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:fe9a4948c64a1602636afb34b13ecb9d0807bc81e107648503832e15c1c11cd8","observation_id":"17df5d75-c7a7-442b-a989-c4916bc2e55e","resolution":{"observed_at":"2026-05-27T02:03:23.629724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17745","last_updated":"2025-01-31T12:45:13Z","snapshot_observed_at":"2026-07-06T20:27:55.860626Z","submitted_at":"2025-01-29T16:32:14Z","title":"Dynamics of Transient Structure in In-Context Linear Regression Transformers","version":2},"cited_work":{"arxiv_id":"2501.17745","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17745","snapshot_observed_at":"2026-07-01T21:16:14.984697Z","title":"Dynamics of transient structure in in-context linear regression transformers","venue":null,"work_id":"f8b882e4-4808-488f-8ac3-073ea0090460","year":2025},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"cited_paper":"/paper/2501.17745","citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:bdaf59a8b43704fdee86356a5b9f05071cf909b2012d4fc39a0b06be72a0b136","observation_id":"b1a2742b-4dcc-4a52-84ff-c41e2239652d","resolution":{"observed_at":"2026-05-11T23:36:36.351014Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Compressed sensing.IEEE Transactions on information theory, 52(4): 1289–1306","venue":null,"work_id":"d59381dd-bc00-43c0-88de-93e0e5bc9d3f","year":2006},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:c9f7266e9746f806092a8fb4cbdeff854b49b011eb3c59204c26e3c7c6804efb","observation_id":"6de3b744-2f48-489a-b346-82906294c5c4","resolution":{"observed_at":"2026-05-27T02:03:23.625138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Uncertainty principles and signal recovery.SIAM Journal on Applied Mathematics, 49(3):906–931","venue":null,"work_id":"67d61243-b6d2-4cf7-946c-8c7d01f3832a","year":1989},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:feeacbb0186d4d9fb651cc14c3aa17bb7951a50ba83e7817172a95ed85b80ce3","observation_id":"892b958c-1366-4c55-8548-3b36de5fbd35","resolution":{"observed_at":"2026-05-27T02:03:23.648176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Duchi, Shai Shalev-Shwartz, Yoram Singer, and Tushar Chandra","venue":null,"work_id":"df8c99b4-8dff-469a-9956-90215e25a1c0","year":2008},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:301d2378e67d9f40aed364400e2db7360cdc4a7bd39249610a97ba58ec274c9a","observation_id":"f9222229-9c05-4182-a7d3-7475c9e7f834","resolution":{"observed_at":"2026-05-09T01:54:34.595706Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The evolution of statistical induction heads: In-context learning markov chains.Advances in neural information processing systems, 37:64273–64311","venue":null,"work_id":"4316a25e-2cdb-4673-b65f-acacf742af4f","year":2024},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:504bc673e548a9db8de3bae482616204737260a7fdfe62a8bcd972758919a941","observation_id":"1e93c86b-ca72-4d10-8883-3f5ff4da4184","resolution":{"observed_at":"2026-05-27T02:03:23.654475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T15:47:23.633494Z","title":"A mathematical framework for transformer circuits.Transformer Circuits Thread","venue":null,"work_id":"4c94841c-40dc-406b-b3cb-0b53da9355a3","year":null},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:a02b7e4b3b1d019e0fb3b39856b5a2d246665142dbf318ef3677151a54c67e85","observation_id":"2aaa826f-5fde-4003-ba9c-add5d6408454","resolution":{"observed_at":"2026-05-27T02:03:23.638033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T15:47:23.640522Z","title":null,"venue":null,"work_id":"f27346c7-0174-47d3-8173-6569b7a87c46","year":2021},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:ae78881bed545446fa5a3f0c5a8316d456da9fe3445caaa1969467065099ccb7","observation_id":"8d145da7-130f-42e3-bb43-13a778881138","resolution":{"observed_at":"2026-05-27T02:03:23.644817Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Toy models of superposition.Transformer Circuits Thread","venue":null,"work_id":"fd62a7a2-c4ee-434e-8f64-da9afa9e5214","year":2022},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:b85cba9185519d38d32d9757284bb1880ae0b95bd087e44fb9e4f158f47defab","observation_id":"f8be15f7-67bd-48fb-aa8e-b4fef03cffb8","resolution":{"observed_at":"2026-05-27T02:03:23.559586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What can transformers learn in-context? a case study of simple function classes.Advances in Neural Information Processing Systems, 35:30583–30598","venue":null,"work_id":"0f6bf562-8695-442d-a499-7c91338e3c3c","year":2022},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:47c4198231158d7d7a4d742b7c734cf649d0c50228ba02637126e2ccf50b7a2b","observation_id":"07140705-bf44-4525-8540-770fc5496d3a","resolution":{"observed_at":"2026-05-27T02:03:23.553274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:45:56.149174Z","title":"Transformer feed-forward layers are key-value memories","venue":null,"work_id":"8ed91ed5-c5c0-4292-be54-e31c0383e9b4","year":2021},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:7a8d1f2685d39170cad77a723be0e868506c70345490bcb2e1b3cedcce55be0c","observation_id":"32cec3f9-cc17-4526-9886-9a37055ef4f0","resolution":{"observed_at":"2026-05-27T02:03:23.563789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.04480","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T21:16:14.954670Z","title":"When models manipulate manifolds: The geometry of a counting task","venue":null,"work_id":"da5f808f-41ef-49cf-99b2-29e0e20b4e37","year":2026},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:b9dc2249b34c9f749f8dbb0914296caef982096ac7d110df7886b889fb328181","observation_id":"6aef1235-57f5-41bf-95a3-0a9f25d3a921","resolution":{"observed_at":"2026-05-11T23:36:36.360333Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.findings-emnlp.624","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T19:14:59.984097Z","title":"In-context learning creates task vectors","venue":null,"work_id":"164bfab3-038a-4eb5-8328-da5b797b32c0","year":2021},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:af9d400b8e5e31ed6d484f3d8443fab4e42a366c0171fbb367ec6710be63c434","observation_id":"688e331c-3bc1-4bc6-932c-b44eec69526f","resolution":{"observed_at":"2026-05-09T01:54:34.562396Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:55.255346+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:55.255346+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In-context learning state vector with inner and momentum optimiza- tion","venue":null,"work_id":"1974d4a1-6729-4827-a741-cd34a2c57566","year":2024},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:f4617892bf4d84aff86749e2e05d4e50115ea201454ce5dcbeaf475492e3b600","observation_id":"ddd6fc35-b877-4fdc-8508-1f9a75fb6080","resolution":{"observed_at":"2026-05-27T02:03:23.578115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f6e6dde7-f123-4c03-b1b0-ab3141e2dfcb","year":2024},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:49fbd581ec2a08d1e005a2bb2cd07c9a4d2cd3d14ae1bfea84e63387f1b768fa","observation_id":"6ef1d277-04af-42f1-a88f-179c32240473","resolution":{"observed_at":"2026-05-27T02:03:23.581117Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0382c951-7fa8-4980-b9bc-f69dcc033fa0","year":2024},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:c42cc473f6c6efd8b89bef9c535f652c4bfb26d1ef641309b358b80acd422720","observation_id":"ae2f3838-cc85-4569-88bb-6c3e376be33c","resolution":{"observed_at":"2026-05-27T02:03:23.537073Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"e13aec66-50fd-4716-895a-0b704e26f56f","year":2019},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:eb8d6c3f03294d24a3d384b65ccb78159d5a910a27fde0e0e8c8675ce6fc447b","observation_id":"8ed046fc-6e36-460c-a363-24ad344c3f6d","resolution":{"observed_at":"2026-05-27T02:03:23.603829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Asymp- totic theory of in-context learning by linear attention.Proceedings of the National Academy of Sciences, 122(28):e2502599122","venue":null,"work_id":"9b84e7e9-23a7-43e4-baec-ac6c360d53e9","year":2025},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:ea4e3c9e8f652abaf0605c049222bd3bcd9885880ab12dd40d4ea1c071c8ac69","observation_id":"71c3ce90-d393-4d38-9060-746dc57cb336","resolution":{"observed_at":"2026-05-27T02:03:23.527272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.naacl-long.281","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:51:44.422508Z","title":"Language Models Implement Simple W ord2 V ec-style Vector Arithmetic","venue":null,"work_id":"e8d4acaf-97fb-4d3b-b712-7f20e760d2ef","year":2024},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:049b8c32c784a3391106677e81013c9ecf18f30cdc79e3bcd344a15134a11cbc","observation_id":"586704c3-d760-47fe-9e12-e8685077edf6","resolution":{"observed_at":"2026-05-09T01:54:34.549977Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T23:54:11.564244+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T23:54:11.564244+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:42:27.227435Z","title":"Distributed representations of words and phrases and their compositionality.Advances in neural information processing systems, 26","venue":null,"work_id":"e952387c-b1bd-418f-86f5-e3d48b77e598","year":2013},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:3bb451babe399b6f9196dc2c64b8e81ce8908d7d9d8d8deda27786f42145bc41","observation_id":"5f9d748b-cd26-4b7a-9834-63ff087195cd","resolution":{"observed_at":"2026-05-27T02:03:23.567668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Linguistic regularities in continuous space word representations","venue":null,"work_id":"8379acb6-8c21-4603-a0af-f1cbcc2ba2c2","year":2013},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:f106162c161ff1d87790ee19da07e21e74d3cdc0747a1c43057a1eedcca22e6a","observation_id":"a7c841d5-ce6c-4435-8faa-db757f4efca7","resolution":{"observed_at":"2026-05-27T02:03:23.543403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":"2209.11895","doi":"10.1145/3411763.3451760","metadata_source":"pith","pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"In-context Learning and Induction Heads","venue":"cs.LG","work_id":"db2b0911-2758-4a2a-99dc-15b14b91bd5e","year":2022},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:67c64103d800b04660dd70a62bd07c7727cc539cf79b1c02b3b2b0c39a5fa465","observation_id":"78d5a1b8-bd9c-47c4-ac3c-16b6254db9d4","resolution":{"observed_at":"2026-05-11T23:36:36.373738Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T02:23:10.795052+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T02:23:10.795052+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What in-context learning “learns” in-context: Disentangling task recognition and task learning","venue":null,"work_id":"20ba9046-34e8-46e9-9d73-4f6fb0b8c134","year":2023},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:a4a3e939ef5a2d1030d9a2a761abf3ab9b5fdb492537401053a4836a5baeb035","observation_id":"e2d07be3-5dfd-41a0-b42d-4b71212e8109","resolution":{"observed_at":"2026-05-27T02:03:23.593182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Competition dynamics shape algorithmic phases of in-context learning","venue":null,"work_id":"fb2cdb90-732a-4b07-b71b-ef66063eee99","year":2025},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:af3ffae01727c7484d853a6565ad1f94df4780031e8c02dc3d7ae9a649d531fd","observation_id":"84efb644-3587-42c5-9cc8-909b96378d56","resolution":{"observed_at":"2026-05-27T02:03:23.599964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The linear representation hypothesis and the geometry of large language models","venue":null,"work_id":"68d3a2a9-13da-47b2-b997-c85004649ba5","year":2024},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:949a06461df2e1ae362ddf704aad99306674df550115df7bf77659337328c273","observation_id":"33c5dc3e-51c7-4b6c-a651-7275d95e8319","resolution":{"observed_at":"2026-05-27T02:03:23.556271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The geometry of categorical and hierarchical concepts in large language models","venue":null,"work_id":"bbcd469b-bab0-43af-8ca0-1f5ca6b7a610","year":2025},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:0b6ff366ebb950312e540c00d450d873865b2153497afcd7816411df3fd930f8","observation_id":"43664998-302c-42ee-a830-693c0089aa9c","resolution":{"observed_at":"2026-05-27T02:03:23.596481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Approximation theory of the mlp model in neural networks.Acta numerica, 8: 143–195","venue":null,"work_id":"daedad18-29a3-44cb-96b1-89f94e0f191d","year":1999},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:78a1da3b53c1ee3aef41869b99ef14dae6f6ff4540dc61a803b2c30027ad811a","observation_id":"4ef955ce-2ab7-4b43-b5bb-144ddd4c4e56","resolution":{"observed_at":"2026-05-27T02:03:23.584470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:65b7926743ac513a4b7992c95558ecc3fe7d51b3c70dbe800c0205a116a97792","observation_id":"49232a37-960f-4b69-ad67-8089ee24791f","resolution":{"observed_at":"2026-05-11T23:36:36.367470Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models are unsupervised multitask learners.OpenAI blog, 1(8):9","venue":null,"work_id":"71f64c51-8e02-447a-939b-5333d2d5d640","year":2019},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:f215b8d910ece8fdb9645ecab047103f8d2cb5b88af55a8ac37d13855e845718","observation_id":"e3e8657e-44f7-45e8-bccc-77b9a901ca21","resolution":{"observed_at":"2026-05-27T02:03:23.589254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pretraining task diversity and the emergence of non-bayesian in-context learning for regression.Advances in neural information processing systems, 36:14228–14246","venue":null,"work_id":"6a318ebd-795e-44b1-94ed-c2f2717eecc1","year":2023},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:2c151e87e5836e2575cbcfec14869ee3aaba5073e63cfd2cff12dd8baa6fb3aa","observation_id":"689beb14-7f54-4479-9f72-dd8082593b09","resolution":{"observed_at":"2026-05-27T02:03:23.615979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.02385","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:09:51.095407Z","title":"Transformers learn factored representations.arXiv preprint arXiv:2602.02385","venue":null,"work_id":"3d1a3cdb-bbe3-44e3-8062-7488642b2b72","year":2026},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:d36fe815c799d24675349eec1272e005e3578378d6d3137ef3fe6e266e245f9e","observation_id":"27aa59d6-bf86-4ec7-92df-4905a5c97e8c","resolution":{"observed_at":"2026-05-11T23:36:36.364038Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformers represent belief state geometry in their residual stream.Advances in Neural Information Processing Systems, 37:75012–75034","venue":null,"work_id":"00e6fae9-32cc-4dda-ac8f-9044436fc79e","year":2024},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:9a6a0b9176637f44266d187def750be93abe73422f4d1804b0a8f9ab1bebcb3a","observation_id":"3575dc73-a2b9-42d1-9a2b-39a54d8acd3c","resolution":{"observed_at":"2026-05-27T02:03:23.571186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04861","last_updated":"2024-02-04T01:49:07Z","snapshot_observed_at":"2026-07-06T16:29:11.973128Z","submitted_at":"2023-10-07T15:50:26Z","title":"Uncovering hidden geometry in Transformers via disentangling position and context","version":2},"cited_work":{"arxiv_id":"2310.04861","doi":"10.48550/arxiv.2310.04861","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.04861","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Uncovering hidden geometry in transformers via disentangling position and context","venue":null,"work_id":"18e250eb-024c-4b93-9c73-155e46ceaded","year":2024},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"cited_paper":"/paper/2310.04861","citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:e7faaf49793aa7c6de8808235e34a7f32fd190c46b820e3750f179bc96d2cd57","observation_id":"2515f8af-2eef-42e0-8b3a-2c6a3cab2338","resolution":{"observed_at":"2026-05-11T23:36:36.382374Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1073/pnas.2417182122","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Out-of-distribution generalization via composition: A lens through induction heads in transformers.Proceedings of the National Academy of Sciences, 122(6):e2417182122","venue":null,"work_id":"15a66967-7a7d-4a91-8fc9-a11eee1f21d6","year":2025},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:d956553bcb578a9fe7334cd437072961a0dbf7c11f8acc6d6bee0c43075ad443","observation_id":"66a94261-7ce7-4e93-9a6c-3c1b2a17c6d2","resolution":{"observed_at":"2026-05-09T01:54:34.543343Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T17:57:26.595007Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063","venue":null,"work_id":"b5fd43ff-336f-45fd-933c-ffddf3003880","year":2024},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:0ee17262185747a5a49444330573dfa09c54a9477b46c76583fbfe57e3bb72d7","observation_id":"6c04bc5c-b193-4e9d-b6b0-222cbf4ce79b","resolution":{"observed_at":"2026-05-27T02:03:23.620783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Daniel Freeman, Theodore R","venue":null,"work_id":"3fe8e59b-a095-4016-b7e1-b7df33d15232","year":2024},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:86a0682c788b6599779a88b6696cabe16707b5cd1f5b293a4c441f47c9e441c1","observation_id":"304bba1c-806e-4c74-9c66-98960494c566","resolution":{"observed_at":"2026-05-27T02:03:23.574776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Function vectors in large language models","venue":null,"work_id":"a8d94ca6-47b2-486c-b5a7-8374cf220803","year":2024},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:5131171d7a6b1c213b86d3f86a17f478c10954ce334831dbae3e150bba7f501d","observation_id":"755a5894-4745-40e2-8257-782e7f9c435a","resolution":{"observed_at":"2026-05-27T02:03:23.550130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:14:51.560415Z","title":null,"venue":null,"work_id":"71a75992-77de-4fec-b468-40ab816842f0","year":1998},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:953636ca572a0c82bedf5be19bcb989df45689d5e13dd104e0ec3e62f8568f82","observation_id":"7259a0f7-13d3-4f9c-96a9-5b7b699d6eb8","resolution":{"observed_at":"2026-05-27T02:03:23.607825Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cambridge Series in Statistical and Probabilistic Mathematics","venue":null,"work_id":"93f2c97a-3716-41fa-a871-5d12b9068d41","year":2018},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:df075ce6467e37fdda885d44586b6c45f3009aa9b7a1234d82c8a6f717c5f127","observation_id":"6f53949b-0f0d-4ea5-8ea1-0e55153036ce","resolution":{"observed_at":"2026-05-27T02:03:23.547045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grokking of implicit reasoning in transformers: A mechanistic journey to the edge of generalization","venue":null,"work_id":"9d7698a6-c789-4b79-a9f6-138f073ed9ff","year":2024},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:cb0e474eabf4606f9959f6dc1b769a70fcc810e14a7883da1d3faf8b858907a8","observation_id":"305d9b09-4855-4f35-847c-490e177802b8","resolution":{"observed_at":"2026-05-27T02:03:23.539946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dif- ferentiation and specialization of attention heads via the refined local learning coefficient","venue":null,"work_id":"c2df803c-d9b0-4362-bee1-295991314473","year":2025},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:142c53d1d1f1d240b8e9d1bc973f4772532cb1fbc88215ef262288b759bbb4d5","observation_id":"eccdde03-1129-4c8d-8c62-4dd1bd6165a7","resolution":{"observed_at":"2026-05-27T02:03:23.524473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03846","last_updated":"2023-03-08T07:37:43Z","snapshot_observed_at":"2026-07-06T14:59:39.238136Z","submitted_at":"2023-03-07T12:24:17Z","title":"Larger language models do in-context learning differently","version":2},"cited_work":{"arxiv_id":"2303.03846","doi":"10.48550/arxiv.2303.03846","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.03846","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"arXiv preprint arXiv:2303.03846 , year =","venue":null,"work_id":"583ca0e5-c312-49d2-a128-f829fccd49e1","year":2023},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"cited_paper":"/paper/2303.03846","citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:6e023b25597f9da61db460f844aed6f406b0df9ad40bf9805fa5dba2a8c9d414","observation_id":"2bc6d862-5e85-4348-a4ce-8ae15f615a1c","resolution":{"observed_at":"2026-05-11T23:36:36.356040Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.emnlp-demos.6","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:06:59.046980Z","title":"Transformers: State-of-the-Art Natural Language Processing","venue":"Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing: System Demonstrations","work_id":"801601a0-1077-41ef-a947-ba81c0b7510f","year":2020},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:aaae36f526d613065274828bf77e2b5f7d953af6b544eb345359b8de624fbfd7","observation_id":"0042f138-9cbe-4707-b936-0cfc74be28f0","resolution":{"observed_at":"2026-05-09T01:54:34.583497Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:48.412582+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:48.412582+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An explanation of in-context learning as implicit bayesian inference","venue":null,"work_id":"ccbafb00-baaf-4586-969a-ecb0dabed376","year":2022},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:6f52ae8c43bca939bbbecf22ffe1d7fcb2a9e505aa119a67859cbc1469a3813f","observation_id":"aac9ea5e-8d27-4942-9b22-36132b202834","resolution":{"observed_at":"2026-05-27T02:03:23.530221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"number of independent directions along whichp(z)varies","venue":null,"work_id":"6aa40833-125b-4cb1-a3e3-a79cc0f09e96","year":2025},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:f0fd11cc66d5a95a22c74c3e677705e1174226111d82fb37956a380c09d2a88d","observation_id":"c48b9019-2157-4498-ae31-a585ab2e8c66","resolution":{"observed_at":"2026-05-27T02:03:23.611744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3a8f1e69-ddc3-4d5a-80fe-642f93ae9da2","year":null},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:82bc6734167bcad7ae58c5c32ce387b7675e974d3f1d1bf60cede525ea7dbab9","observation_id":"a7aee1e9-16f0-4557-ad84-afd9fc11c25f","resolution":{"observed_at":"2026-05-27T02:03:23.534024Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"table”→“t","venue":null,"work_id":"de8a4172-fec0-416b-9ae3-e28ddd10739f","year":null},"citing_paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:26.420806Z"},"links":{"citing_paper":"/paper/2605.03780"},"observation_digest":"sha256:58784150a6b0ef2d7a0e04676e71b6511f646dda3fa1b6c955b59952a888ea06","observation_id":"295b9d83-ee57-423c-804d-22b023277198","resolution":{"observed_at":"2026-05-27T02:03:23.521408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.03780","last_updated":"2026-05-05T14:07:55Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T05:55:01.910212Z","submitted_at":"2026-05-05T14:07:55Z","title":"Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":5,"verified_exact":11,"verified_fuzzy":34},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2605.03780."}