{"as_of":"2026-08-08T19:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ac10ed2d27e975ed7be44785fcc2bae44216219131649e4dceed4b38622db01d","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:18:21.386846Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.04243/citation-record","integrity":"/paper/2608.04243/integrity","json":"/paper/2608.04243/citation-record.json","paper":"/paper/2608.04243"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.22840","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:21.924752Z","title":"A capacity-based rationale for multi-head attention, 2026","venue":null,"work_id":"57fa89cb-877e-4717-9687-b87e15a16de9","year":2026},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-08T19:11:30.993381Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.246895Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:443b64d3327bb66c34d4caa50e466ac135af45fccc0ed70594e97c0fadb9009a","observation_id":"beca5942-c7bd-4a69-a1f4-a74eb67ecc8b","resolution":{"observed_at":"2026-08-08T00:18:21.930876Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:22.128556Z","title":"Online linear optimization and adaptive routing","venue":null,"work_id":"08f79724-dc0c-4eef-a4c1-14aa343b4635","year":2008},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-08T19:11:30.993381Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.251607Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:0492ea556b6d9d7a62fb980176061f72e1548905b7c83b77fcb25f047f903fa6","observation_id":"dff403db-43f9-48c3-95ba-d46f7a33e432","resolution":{"observed_at":"2026-08-08T00:18:22.132620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:22.117179Z","title":"Some extremal postage stamp bases.Journal of Integer Sequences, 13(2):3, 2010","venue":null,"work_id":"2cfa8c58-bb4d-4528-aee1-ae42f7ebb2ea","year":2010},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-08T19:11:30.993381Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.255630Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:857020cce6a55e0bd4ef3fc89f20da2cb862a7599774aa6b74919746765e9929","observation_id":"37b95261-b3f7-497e-82ab-6f6528edcac0","resolution":{"observed_at":"2026-08-08T00:18:22.121254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:22.105604Z","title":"Theoretical limitations of multi-layer transformer,","venue":null,"work_id":"501fe4d3-a56b-46fe-9f12-a5b21b3bb38b","year":null},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-08T19:11:30.993381Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.259710Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:f41e8a1b996f41169945c296f2623b369c18b1057e967bed56c0e4fe8beacd36","observation_id":"91d939f6-4857-40d5-a19e-3a968f32c2ac","resolution":{"observed_at":"2026-08-08T00:18:22.109810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.10743","last_updated":"2023-11-13T15:19:02Z","snapshot_observed_at":"2026-07-06T14:44:38.168186Z","submitted_at":"2023-01-25T18:05:55Z","title":"Tighter Bounds on the Expressivity of Transformer Encoders","version":3},"cited_work":{"arxiv_id":"2301.10743","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.10743","snapshot_observed_at":"2026-08-08T00:18:21.838745Z","title":"Tighter Bounds on the Expressivity of Transformer Encoders","venue":"cs.LG","work_id":"c3ac68ef-12e8-4c2b-993f-77df20f28133","year":2023},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-08T19:11:30.993381Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.268399Z"},"links":{"cited_paper":"/paper/2301.10743","citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:27b3f781d42b2d53aa0f2ec1bd28daf8cbbaeb22f115eefeaa6747072509ce6e","observation_id":"9cf18003-55b1-4a52-b4f4-47e9154309bc","resolution":{"observed_at":"2026-08-08T00:18:21.843522Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-08T00:18:21.272654Z","title":"BERT: Pre-training of deep bidirectional transformers for language understanding, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-08T19:11:30.993381Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.272654Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:088e971041141d80fe6368747cc675d1ab7b2092b5c6e25600a39750a5327539","observation_id":"c82b1c13-e4ca-4443-b178-b469ed5a78cc","resolution":{"observed_at":"2026-08-08T00:18:21.272654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.09434","last_updated":"2021-03-30T04:06:04Z","snapshot_observed_at":"2026-08-03T22:59:07.969421Z","submitted_at":"2020-02-21T17:30:00Z","title":"Few-Shot Learning via Learning the Representation, Provably","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.09434","snapshot_observed_at":"2026-08-08T00:18:21.277169Z","title":"Du, Wei Hu, Sham M","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-08T19:11:30.993381Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.277169Z"},"links":{"cited_paper":"/paper/2002.09434","citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:2e2a83128da49cdee8ed6788376f77c999b87e575fb48cbc58f47affc7e7c3eb","observation_id":"7b7015f8-7cdc-48a0-b17e-60dd87d12b1d","resolution":{"observed_at":"2026-08-08T00:18:21.277169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:22.092768Z","title":"A combinatorial problem in geometry.Compositio Mathematica, 2:463–470, 1935","venue":null,"work_id":"07b68f0c-2445-4c55-a77b-57544aca7a37","year":1935},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-08T19:11:30.993381Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.281858Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:47a06468bf2a524089a392ff4d0f54a4f43790a0abd14a19e2ee94984c050854","observation_id":"f7d4dd3e-54d0-45c9-9e5f-d9eaa98c5cb1","resolution":{"observed_at":"2026-08-08T00:18:22.096681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:21.285854Z","title":"Theoretical limitations of self-attention in neural sequence models.Transactions of the Association for Computational Linguistics, 8:156–171, December 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-08T19:11:30.993381Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.285854Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:23b2bac2b5250c4da0e3f299cf4ee259cbd258081a4cb2f0a671d1247cacdab2","observation_id":"f27f124b-e4fe-40d2-bf18-cdfa8703c07d","resolution":{"observed_at":"2026-08-08T00:18:21.285854Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:22.081308Z","title":"Formal language recognition by hard attention transformers: Perspectives from circuit complexity, 2022","venue":null,"work_id":"c344faa0-3cc6-41ec-b085-2f296d50a5a4","year":2022},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-08T19:11:30.993381Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.289984Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:20954dcc228332778b226467e643bfa550373efa67065cf94ae30be1753774f7","observation_id":"61a25a05-573c-400f-abd0-ff91a56e996d","resolution":{"observed_at":"2026-08-08T00:18:22.085791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14023","last_updated":"2024-01-29T10:16:41Z","snapshot_observed_at":"2026-08-07T22:03:55.081986Z","submitted_at":"2023-07-26T08:07:37Z","title":"Are Transformers with One Layer Self-Attention Using Low-Rank Weight Matrices Universal Approximators?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.14023","snapshot_observed_at":"2026-08-08T00:18:21.293789Z","title":"Are transformers with one layer self-attention using low-rank weight matrices universal approximators?, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-08T19:11:30.993381Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.293789Z"},"links":{"cited_paper":"/paper/2307.14023","citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:b0423b551e7fa8ecbbf5894b84b2772af467ea334439caeacf3415003712194f","observation_id":"9f7f622e-23d4-439d-815b-2f3e9dd54550","resolution":{"observed_at":"2026-08-08T00:18:21.293789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20195","last_updated":"2024-12-28T16:09:25Z","snapshot_observed_at":"2026-07-06T20:14:08.237082Z","submitted_at":"2024-12-28T16:09:25Z","title":"Lower bounds on transformers with infinite precision","version":1},"cited_work":{"arxiv_id":"2412.20195","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.20195","snapshot_observed_at":"2026-08-08T00:18:21.788685Z","title":"Lower bounds on transformers with infinite precision","venue":"cs.LG","work_id":"2fec59f4-3430-4cf7-b642-4eb983d2d803","year":2024},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-08T19:11:30.993381Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.297935Z"},"links":{"cited_paper":"/paper/2412.20195","citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:7408635c075f0dee73336bd0a8d8cca2a4458cebf4ecbc0aba9aa5417566ad76","observation_id":"49c33eec-0cf9-45d5-a364-6c2c18a18adb","resolution":{"observed_at":"2026-08-08T00:18:21.793091Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.05896","last_updated":"2026-05-07T02:31:59Z","snapshot_observed_at":"2026-07-06T22:44:42.380489Z","submitted_at":"2026-02-05T17:14:33Z","title":"Parity, Sensitivity, and Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.05896","snapshot_observed_at":"2026-08-08T00:18:21.302058Z","title":"Parity, sensitivity, and transformers, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-08T19:11:30.993381Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.302058Z"},"links":{"cited_paper":"/paper/2602.05896","citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:00ff5ad6bfcc586eb0f79de067111ec1d2f350569b4c401050fe9bb9f561b237","observation_id":"76a9cb42-cb5e-4237-a28f-f33abdec2ea0","resolution":{"observed_at":"2026-08-08T00:18:21.302058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.03130","last_updated":"2017-03-09T04:42:30Z","snapshot_observed_at":"2026-08-01T16:29:44.580051Z","submitted_at":"2017-03-09T04:42:30Z","title":"A Structured Self-attentive Sentence Embedding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.03130","snapshot_observed_at":"2026-08-08T00:18:21.306038Z","title":"A structured self-attentive sentence embedding, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-08T19:11:30.993381Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.306038Z"},"links":{"cited_paper":"/paper/1703.03130","citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:b20c82184b72c6d7052bf099f01c07fc4533f8f9c6642c47234f1ac2d97acd84","observation_id":"5fb54950-2674-4625-a638-182a5182679b","resolution":{"observed_at":"2026-08-08T00:18:21.306038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10749","last_updated":"2023-05-02T14:16:15Z","snapshot_observed_at":"2026-08-05T14:55:09.743440Z","submitted_at":"2022-10-19T17:45:48Z","title":"Transformers Learn Shortcuts to Automata","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.10749","snapshot_observed_at":"2026-08-08T00:18:21.309970Z","title":"Ash, Surbhi Goel, Akshay Krishnamurthy, and Cyril Zhang","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-08T19:11:30.993381Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.309970Z"},"links":{"cited_paper":"/paper/2210.10749","citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:6b4de9d3dbc97659a24b8c142409cc936c29128aaa5fe5ae13bcdd905a03040e","observation_id":"caefcef9-4e90-4bb7-942e-547adae906e2","resolution":{"observed_at":"2026-08-08T00:18:21.309970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00729","last_updated":"2023-04-26T22:34:12Z","snapshot_observed_at":"2026-07-06T13:27:03.598212Z","submitted_at":"2022-07-02T03:49:34Z","title":"The Parallelism Tradeoff: Limitations of Log-Precision Transformers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00729","snapshot_observed_at":"2026-08-08T00:18:21.313898Z","title":"The parallelism tradeoff: Limitations of log-precision transformers, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-08T19:11:30.993381Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.313898Z"},"links":{"cited_paper":"/paper/2207.00729","citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:fd4c0efd37ec9811286fd49976f696cd4dd4a28a51fcdc776d89f2695f6513c2","observation_id":"47e1666f-4154-4b48-8459-8b05e6873af5","resolution":{"observed_at":"2026-08-08T00:18:21.313898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:21.317980Z","title":"A little depth goes a long way: The expressive power of log-depth transformers, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-08T19:11:30.993381Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.317980Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:a291ca45568674d781a79c94a41010cf37f1194f446ee4be6bc25d17bf7294c6","observation_id":"71fd7570-6819-4b95-ac42-3ab8b4eddf44","resolution":{"observed_at":"2026-08-08T00:18:21.317980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:22.068529Z","title":"MIT Press, 1969","venue":null,"work_id":"1b389efd-f79c-4461-a3f7-d0a2c8ae576f","year":1969},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-08T19:11:30.993381Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.321519Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:57bf05480c05761ba2295f42ef8cedf1e360fcf8425a46adbfe53751a326b7df","observation_id":"2d75c8df-a37a-42e2-8d8a-d4781998d7e0","resolution":{"observed_at":"2026-08-08T00:18:22.073725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:22.056540Z","title":"On extremalh-basesA 4.Mathematica Scandinavica, pages 5–16, 1987","venue":null,"work_id":"daf17d5e-b1ab-4af1-a148-1a66309d34c4","year":1987},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-08T19:11:30.993381Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.325523Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:cbfc61901bd59b9eef270ccd58c45bf11d1cae07f3dea9001dce4bc1c19a7cce","observation_id":"24014eb0-7bb2-4264-8ee1-3be0cf195f86","resolution":{"observed_at":"2026-08-08T00:18:22.060522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:22.043997Z","title":"Parikh, Oscar T¨ ackstr¨ om, Dipanjan Das, and Jakob Uszkoreit","venue":null,"work_id":"d56c3393-6f82-4564-b2ff-3839c6e2cf3a","year":2016},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-08T19:11:30.993381Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.329456Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:6d7004f8439b710d4f709999bfb667547a9d682a81b5bc81be0c97de6ab645b5","observation_id":"498004a0-0b53-4e41-aa13-dd2a21b536ff","resolution":{"observed_at":"2026-08-08T00:18:22.048792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08164","last_updated":"2024-02-26T22:12:37Z","snapshot_observed_at":"2026-08-03T19:03:45.697344Z","submitted_at":"2024-02-13T01:52:15Z","title":"On Limitations of the Transformer Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08164","snapshot_observed_at":"2026-08-08T00:18:21.333110Z","title":"On limitations of the transformer architecture, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-08T19:11:30.993381Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.333110Z"},"links":{"cited_paper":"/paper/2402.08164","citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:12fd11424ea6dc4ce3dd5740e5de9b27655e776172f6ac5c2a1ebab8ae9063a0","observation_id":"3d1fc906-9e41-496d-9e51-3b2d265a29ef","resolution":{"observed_at":"2026-08-08T00:18:21.333110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02896","last_updated":"2023-11-16T14:48:16Z","snapshot_observed_at":"2026-08-07T11:02:21.213228Z","submitted_at":"2023-06-05T14:05:04Z","title":"Representational Strengths and Limitations of Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02896","snapshot_observed_at":"2026-08-08T00:18:21.336902Z","title":"Representational strengths and limitations of transformers, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-08T19:11:30.993381Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.336902Z"},"links":{"cited_paper":"/paper/2306.02896","citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:426735b538ef161d6aae8be50eff4d4083d1361f9fac14a277998c11bd47cb77","observation_id":"d33e055e-3c73-4dd4-b5af-c34cfbdbbfa7","resolution":{"observed_at":"2026-08-08T00:18:21.336902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14332","last_updated":"2024-08-26T15:01:04Z","snapshot_observed_at":"2026-07-06T19:06:01.833508Z","submitted_at":"2024-08-26T15:01:04Z","title":"One-layer transformers fail to solve the induction heads task","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14332","snapshot_observed_at":"2026-08-08T00:18:21.340892Z","title":"One-layer transformers fail to solve the induction heads task, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-08T19:11:30.993381Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.340892Z"},"links":{"cited_paper":"/paper/2408.14332","citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:21c170594a2ce26b9ecd53a95a991d56f782da5a2112d4541ba08a4634147b96","observation_id":"051c6149-ca24-471d-b529-490d31c9ce77","resolution":{"observed_at":"2026-08-08T00:18:21.340892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09268","last_updated":"2024-02-14T15:54:55Z","snapshot_observed_at":"2026-07-06T17:30:03.953345Z","submitted_at":"2024-02-14T15:54:55Z","title":"Transformers, parallel computation, and logarithmic depth","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09268","snapshot_observed_at":"2026-08-08T00:18:21.344801Z","title":"Transformers, parallel computation, and logarithmic depth, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-08T19:11:30.993381Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.344801Z"},"links":{"cited_paper":"/paper/2402.09268","citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:06cf88deac8c60459c75d37814095a8ac55f82efc7aed4fa3ac126329a4e78a0","observation_id":"48531fbb-2db5-48df-81aa-e580a0e89e06","resolution":{"observed_at":"2026-08-08T00:18:21.344801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:22.032274Z","title":"Michael Steele","venue":null,"work_id":"275173fd-1061-4a34-ab2c-6fc5ddb4afff","year":1995},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-08T19:11:30.993381Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.348843Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:f9916e0e891a092adc966d875e8892a3d2301a1595ee6f7431338dafc98001de","observation_id":"3572037c-6138-493a-9579-9af6931d4231","resolution":{"observed_at":"2026-08-08T00:18:22.036272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:22.018931Z","title":"Two (narrow) heads are better than (an arbitrarily wide) one","venue":null,"work_id":"e1ba0eaa-1368-414e-a453-6b742eb6604f","year":2026},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-08T19:11:30.993381Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.352690Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:e7248b44dc0c56247e1d63db0d0a2f48e25478f33b3b73ecea121d59cd36f041","observation_id":"1bc22d14-85ab-4ab8-9226-780acbecdcd3","resolution":{"observed_at":"2026-08-08T00:18:22.023694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.11684","last_updated":"2022-01-01T01:50:02Z","snapshot_observed_at":"2026-07-06T09:00:23.866491Z","submitted_at":"2020-02-26T18:21:34Z","title":"Provable Meta-Learning of Linear Representations","version":5},"cited_work":{"arxiv_id":"2002.11684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2002.11684","snapshot_observed_at":"2026-08-08T00:18:21.599543Z","title":"Provable Meta-Learning of Linear Representations","venue":"cs.LG","work_id":"4518aa9b-1c2d-4ced-9a0a-978c3c10943f","year":2020},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-08T19:11:30.993381Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.356398Z"},"links":{"cited_paper":"/paper/2002.11684","citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:a16717557385009ca09c17646dd57187652c69ee89e4c4e4f7f550a793ed8859","observation_id":"d4d4992b-038f-4689-84bd-dee00bacecc8","resolution":{"observed_at":"2026-08-08T00:18:21.606190Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-08T00:18:21.360698Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-08T19:11:30.993381Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.360698Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:c93e493fea0b2056c804b26d7e2c76f0dd63ea2c8b10c360025eafd961c6fde9","observation_id":"8fd733dc-924f-484b-93c3-d12b024079b5","resolution":{"observed_at":"2026-08-08T00:18:21.360698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:22.005967Z","title":"How many attention heads do you need to do XOR? Less- Wrong, April 2026","venue":null,"work_id":"678f906d-53ea-4064-b780-f96946722434","year":2026},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-08T19:11:30.993381Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.364343Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:6ac38a8a44ba7fda0408e5795954956f7a769c0446717b27871471f900a9fa49","observation_id":"2408cfa7-0502-41ae-b245-066f891eae5c","resolution":{"observed_at":"2026-08-08T00:18:22.010506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:21.368013Z","title":"The effect of attention head count on transformer approximation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-08T19:11:30.993381Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.368013Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:fc7f6040a13bf7ad55a69ada15bfe69f0ac3956d72fed7ed8c36fae36ff72a9b","observation_id":"5d9b7bb5-d0d6-46f8-abba-e9f5e21e4e7f","resolution":{"observed_at":"2026-08-08T00:18:21.368013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:21.992617Z","title":"On model selection consistency of Lasso.Journal of Machine Learning Research, 7(90):2541–2563, 2006","venue":null,"work_id":"481ff363-64ef-481a-93ce-26ee0dcdcb7a","year":2006},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-08T19:11:30.993381Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.371426Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:c27a76b7d9c3b23065ce5eb67b243d29fe680ad237cb0341a8aa611a3f5e8248","observation_id":"27bcb3fe-850e-417f-ba15-f50b2327d058","resolution":{"observed_at":"2026-08-08T00:18:21.996759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:21.980441Z","title":"The minimum isx, so MX i=1 hi∆x,y i >0","venue":null,"work_id":"5dbb3d92-f161-46ad-9f20-e1430173b805","year":null},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-08T19:11:30.993381Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.375082Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:a58bffe46691d17da534ee63d0ce21a3d18ba640c88ad689c7ed368b17eb9422","observation_id":"4e66ea80-6457-42b4-a9a8-0a56c692998e","resolution":{"observed_at":"2026-08-08T00:18:21.984579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:21.965590Z","title":"The minimum isy, so MX i=1 hi∆x,y i <0","venue":null,"work_id":"803d444e-983e-49bf-9d33-c322d34005b5","year":null},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-08T19:11:30.993381Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.379016Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:73a6f3a4e36573ba82d321e93d503a3acb5356ae5dc3861a132ac433d30ed431","observation_id":"3049d316-95d1-4bbb-99a4-76cc3c1f9525","resolution":{"observed_at":"2026-08-08T00:18:21.969906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:21.952865Z","title":"The minimum is x, so MX i=1 hi∆x,y i >0","venue":null,"work_id":"a69d38a8-429c-44f5-b142-898a066471c1","year":null},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-08T19:11:30.993381Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.382881Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:009638e948d9ec3acb4f836e218cccbce73e94930e865ea48c5de187ede16355","observation_id":"671be709-4fd8-4075-93f0-72aa06b3852b","resolution":{"observed_at":"2026-08-08T00:18:21.957041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:21.940306Z","title":"The minimum is y, so MX i=1 hi∆x,y i <0","venue":null,"work_id":"37136a9b-4ddf-4c4b-b02e-302004c3a896","year":null},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-08T19:11:30.993381Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.386846Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:9deed6c4c106fcbe444d565e5abfc91f8661e0f70931df778810bd8230c69e64","observation_id":"28a3a314-70e2-4275-85c7-7c5200590df7","resolution":{"observed_at":"2026-08-08T00:18:21.944419Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-08-08T18:12:49.793504Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-08-08T00:18:21.263783Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-08T19:11:30.993381Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.263783Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:127507f9e4346ec1d8d7f530dd35c808bd7cb74d5d0d423e24ae68ea8eddddab","observation_id":"2b3d7df0-27b4-4bd4-bce4-d824ce19a4e0","resolution":{"observed_at":"2026-08-08T00:18:21.263783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T19:11:30.993381Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":4,"verified_fuzzy":15},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2608.04243."}