{"as_of":"2026-08-05T02:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ba775ed09b6956ac378a5f6f54c206be4dabdeae6160065905616eb20fa18264","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T06:39:04.312270Z","state":"measured"},{"denominator":140,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":140,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":65,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T01:39:47.872763Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T14:57:14.484456Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2604.03190","last_updated":"2026-05-03T22:02:33Z","snapshot_observed_at":"2026-07-06T22:52:25.307426Z","submitted_at":"2026-04-03T17:06:08Z","title":"Gradient Boosting within a Single Attention Layer","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T20:23:40.027519Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2604.03190"},"observation_digest":"sha256:15fa44cd0f9c1e2e10b5ae99c518ce75b91d42bb1932c224f453d76b191d5b53","observation_id":"c10814fc-5120-4d89-b839-83788e6180bd","resolution":{"observed_at":"2026-05-21T06:39:04.582456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2604.03297","last_updated":"2026-03-28T15:40:57Z","snapshot_observed_at":"2026-07-06T22:52:29.705312Z","submitted_at":"2026-03-28T15:40:57Z","title":"XAttnRes: Cross-Stage Attention Residuals for Medical Image Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-14T22:30:32.341442Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2604.03297"},"observation_digest":"sha256:cc6fff840bc9085542335faa514f68ad1cebeaff00180548d1fe7f6120c0d33c","observation_id":"7c0a0642-7095-49c8-9ede-11240286477b","resolution":{"observed_at":"2026-05-21T06:39:04.582456Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-13T11:46:35.757645Z","title":"Attention Residuals","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2604.03955","last_updated":"2026-04-05T04:10:15Z","snapshot_observed_at":"2026-07-13T11:46:30.434305Z","submitted_at":"2026-04-05T04:10:15Z","title":"Symbolic-Vector Attention Fusion for Collective Intelligence","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-13T11:46:35.757645Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2604.03955"},"observation_digest":"sha256:837795af1d723bcafde10b902e81d1fc75bf83bee6e85d0d84a0d59b46ff969f","observation_id":"7cc6aa49-8b05-4c51-80d2-a08f42c68219","resolution":{"observed_at":"2026-07-13T11:46:35.757645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-13T10:31:11.574398Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2604.04250","last_updated":"2026-04-05T20:13:22Z","snapshot_observed_at":"2026-07-13T10:31:06.168413Z","submitted_at":"2026-04-05T20:13:22Z","title":"CAWN: Continuous Acoustic Wave Networks for Autoregressive Language Modeling","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-13T10:31:11.574398Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2604.04250"},"observation_digest":"sha256:acc7ccf877465628ee67c285e8a0c5bccfb0fe64182134cdfe19b830abafee18","observation_id":"5707d348-5794-4cb8-bf38-5e6e9bcb18a6","resolution":{"observed_at":"2026-07-13T10:31:11.574398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2604.15593","last_updated":"2026-04-17T00:25:32Z","snapshot_observed_at":"2026-07-06T23:03:07.228701Z","submitted_at":"2026-04-17T00:25:32Z","title":"DALM: A Domain-Algebraic Language Model via Three-Phase Structured Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T08:47:16.826911Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2604.15593"},"observation_digest":"sha256:10af0e42795a72967823aa29f95fdaf36a490835e64bbc5aca5bd3c75491ae48","observation_id":"00f470b5-475e-4dbf-9742-16ccf21ff715","resolution":{"observed_at":"2026-05-21T06:39:04.582456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2604.21254","last_updated":"2026-07-02T01:19:03Z","snapshot_observed_at":"2026-07-06T23:07:51.979267Z","submitted_at":"2026-04-23T03:46:14Z","title":"Hyperloop Transformers","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-09T23:09:35.640412Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2604.21254"},"observation_digest":"sha256:9150ec35bb3628d09dd843bfc565a508f4a632135794c047885913361ad8b8a3","observation_id":"72ec83d9-8ad3-4191-8b0b-79091258bd26","resolution":{"observed_at":"2026-05-21T06:39:04.582456Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2605.01376","last_updated":"2026-05-02T10:55:40Z","snapshot_observed_at":"2026-07-06T23:14:38.379875Z","submitted_at":"2026-05-02T10:55:40Z","title":"A Cellular Doctrine of Morality: Intrinsic Active Precision and the Mind-Reality Overload Dilemma","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-09T14:26:52.393248Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2605.01376"},"observation_digest":"sha256:70fcbe36f99e099fac54d47d128ba9c34985c85fd0f227726c2767eee3695c6c","observation_id":"67c4b4fc-fc44-44f7-912c-eb4cb51e43d8","resolution":{"observed_at":"2026-05-21T06:39:04.582456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2605.03953","last_updated":"2026-05-06T01:32:44Z","snapshot_observed_at":"2026-07-06T23:16:49.553583Z","submitted_at":"2026-05-05T16:38:29Z","title":"Transformers with Selective Access to Early Representations","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-07T16:16:42.491035Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2605.03953"},"observation_digest":"sha256:e82eb7dff88b9ed112d9bd32beb955b224211dc747a722a889633bafb7232735","observation_id":"f23cbd4b-2acd-40fb-9810-39910ab9ae77","resolution":{"observed_at":"2026-05-21T06:39:04.582456Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2605.03953","last_updated":"2026-05-06T01:32:44Z","snapshot_observed_at":"2026-07-06T23:16:49.553583Z","submitted_at":"2026-05-05T16:38:29Z","title":"Transformers with Selective Access to Early Representations","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-08T18:10:31.448311Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2605.03953"},"observation_digest":"sha256:6682787394ee4dec5489999cbe2b2db68c16607743f889068ddaa45af0cc1ba3","observation_id":"eff4cbb6-4a3e-4c85-bb36-78f90b227c87","resolution":{"observed_at":"2026-05-21T06:39:04.582456Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2605.05394","last_updated":"2026-05-06T19:26:56Z","snapshot_observed_at":"2026-07-06T23:18:02.987518Z","submitted_at":"2026-05-06T19:26:56Z","title":"BARFI-Q: Quantum-Enhanced Block Attention Residual Fusion Framework for Multivariate Time-Series Forecasting in Atom Interferometry","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-08T16:28:30.205669Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2605.05394"},"observation_digest":"sha256:e5f701f6c8a2c86fd424d7e7a13f1137ff570c8376df72dc57912cf8f4b3f6e5","observation_id":"030ccf04-6ec5-451e-a95b-8369a8fca9d5","resolution":{"observed_at":"2026-05-21T06:39:04.582456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2605.06317","last_updated":"2026-06-06T04:13:49Z","snapshot_observed_at":"2026-08-01T16:06:18.480696Z","submitted_at":"2026-05-07T14:16:58Z","title":"NavOne: One-Step Global Planning for Vision-Language Navigation on Top-Down Maps","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-08T13:33:55.535856Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2605.06317"},"observation_digest":"sha256:19bef6644e0f704f090fd1e9b4478d8acf9cc442ca8ded50d6aeb3a646d07c3d","observation_id":"0dd98c88-209c-4282-b0e1-c2d561e7b124","resolution":{"observed_at":"2026-05-21T06:39:04.582456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2605.06317","last_updated":"2026-06-06T04:13:49Z","snapshot_observed_at":"2026-08-01T16:06:18.480696Z","submitted_at":"2026-05-07T14:16:58Z","title":"NavOne: One-Step Global Planning for Vision-Language Navigation on Top-Down Maps","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-11T00:50:11.709217Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2605.06317"},"observation_digest":"sha256:9727649f90bd1b4e81e0c6812466548929e92824f093206475c519ea7cc8a5d1","observation_id":"cb90e315-dc66-41e1-bf93-66a615c8c60b","resolution":{"observed_at":"2026-05-21T06:39:04.582456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2605.06317","last_updated":"2026-06-06T04:13:49Z","snapshot_observed_at":"2026-08-01T16:06:18.480696Z","submitted_at":"2026-05-07T14:16:58Z","title":"NavOne: One-Step Global Planning for Vision-Language Navigation on Top-Down Maps","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T23:13:41.784895Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2605.06317"},"observation_digest":"sha256:dc4c0e399fe03a3c2061b9e5b1ba2b36559d868ca274c609f7bdf152bf0fd264","observation_id":"15a0b7b6-bb29-4afb-b2f1-539669c54ba1","resolution":{"observed_at":"2026-05-21T06:39:04.582456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2605.06317","last_updated":"2026-06-06T04:13:49Z","snapshot_observed_at":"2026-08-01T16:06:18.480696Z","submitted_at":"2026-05-07T14:16:58Z","title":"NavOne: One-Step Global Planning for Vision-Language Navigation on Top-Down Maps","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T23:22:52.586386Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2605.06317"},"observation_digest":"sha256:dd1d0c9c52b6f93ce3053f9717dc961af052b84dacc55f933a0b6a7f5ec70049","observation_id":"abb3668b-bb59-4bc0-b692-1def4b362237","resolution":{"observed_at":"2026-06-30T23:25:07.733791Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-08T12:38:19.925573Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:5033f637d38e6f564ee45259b28975c3508b5f5d8819c961bb7dc6ce3be3a0eb","observation_id":"257c9278-1dab-47d9-a00e-09aab3f41368","resolution":{"observed_at":"2026-05-21T06:39:04.582456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2605.06501","last_updated":"2026-05-19T06:54:59Z","snapshot_observed_at":"2026-08-02T05:36:24.593005Z","submitted_at":"2026-05-07T16:18:55Z","title":"Cubit: Token Mixer with Kernel Ridge Regression","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-20T22:34:36.108826Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2605.06501"},"observation_digest":"sha256:e98cd6dd6bdc1c11e2a68cda4f17d8cfdeaf8a15313e8023ecd8cca3ac762e1c","observation_id":"952ccb53-69f2-43d9-a6c4-4079a02d0cc9","resolution":{"observed_at":"2026-05-21T06:39:04.582456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2605.08234","last_updated":"2026-05-07T00:36:59Z","snapshot_observed_at":"2026-07-31T05:45:32.518785Z","submitted_at":"2026-05-07T00:36:59Z","title":"When Does Value-Aware KV Eviction Help? A Fixed-Contract Diagnostic for Non-Monotone Cache Compression","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T01:46:59.423533Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2605.08234"},"observation_digest":"sha256:601fd347119157c10f44647569b742bdd47fdf75b3d5b7b0e99417da762b3db1","observation_id":"61df5385-2b6e-4b84-9ea8-4b283da93d0d","resolution":{"observed_at":"2026-05-21T06:39:04.582456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2605.08423","last_updated":"2026-05-08T19:32:43Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T19:32:43Z","title":"Queryable LoRA: Instruction-Regularized Routing Over Shared Low-Rank Update Atoms","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T00:59:21.421307Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2605.08423"},"observation_digest":"sha256:8b01232a45450c9112a039651e9096ce0e55d5ee0bb4448348d3e8d502470ffb","observation_id":"bd770621-b7ab-4906-b503-cd89b44247af","resolution":{"observed_at":"2026-05-21T06:39:04.582456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2605.08806","last_updated":"2026-05-12T04:05:06Z","snapshot_observed_at":"2026-07-06T23:20:57.084438Z","submitted_at":"2026-05-09T08:48:20Z","title":"L2A: Learning to Accumulate Pose History for Accurate 3D Human Pose Estimation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T01:03:10.891107Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2605.08806"},"observation_digest":"sha256:0bbcd015c4d552dc018d2b5e42daa7cb17b5e49ce701a28ed8e06758b2996776","observation_id":"de495717-7d47-4ca6-bc1a-68113a868ea6","resolution":{"observed_at":"2026-05-21T06:39:04.582456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2605.08806","last_updated":"2026-05-12T04:05:06Z","snapshot_observed_at":"2026-07-06T23:20:57.084438Z","submitted_at":"2026-05-09T08:48:20Z","title":"L2A: Learning to Accumulate Pose History for Accurate 3D Human Pose Estimation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T07:03:13.904357Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2605.08806"},"observation_digest":"sha256:d6bc94f59196c383d995b9b62aa7fa11a376f275f66e61c61664f89d5ee158e6","observation_id":"46c8beb2-6ace-4b6e-a5bf-1ced0d8c57d9","resolution":{"observed_at":"2026-05-21T06:39:04.582456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2605.09196","last_updated":"2026-05-09T22:31:09Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-09T22:31:09Z","title":"RigidFormer: Learning Rigid Dynamics using Transformers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T02:18:19.764706Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2605.09196"},"observation_digest":"sha256:1ce6ecab178c8d5a5873ea07fbfe82270ac33c1618db2201c5daeecef0f32635","observation_id":"7eb30562-3fc6-4402-8f3f-02245e83f7b2","resolution":{"observed_at":"2026-05-21T06:39:04.582456Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2605.09992","last_updated":"2026-05-11T05:08:39Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T05:08:39Z","title":"Attention Drift: What Autoregressive Speculative Decoding Models Learn","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T02:14:31.291528Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2605.09992"},"observation_digest":"sha256:7e8c2ebec4ea669e90805bd39c9e6c2a53e06d39a735da724f9ab99782b2e11e","observation_id":"1c9b20d8-3669-486f-a094-0ab4d07a05c8","resolution":{"observed_at":"2026-05-21T06:39:04.582456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2605.11011","last_updated":"2026-05-10T11:05:20Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T11:05:20Z","title":"LoopUS: Recasting Pretrained LLMs into Looped Latent Refinement Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-13T07:21:04.820743Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2605.11011"},"observation_digest":"sha256:99973733d7936b3f8135a1dc82b6095aef8b6d081bf624dcb586148865bca897","observation_id":"c4251de7-1817-4176-80a0-0f497771c026","resolution":{"observed_at":"2026-05-21T06:39:04.582456Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2605.12374","last_updated":"2026-05-25T11:34:51Z","snapshot_observed_at":"2026-08-03T09:32:16.807759Z","submitted_at":"2026-05-12T16:41:09Z","title":"Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-13T07:21:40.803291Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2605.12374"},"observation_digest":"sha256:674a372746b16148c34615a6a174b7503d576d54d3198641e869fafc4402d609","observation_id":"1c46ef78-db00-4907-9aea-0aa11011825b","resolution":{"observed_at":"2026-05-21T06:39:04.582456Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2605.12374","last_updated":"2026-05-25T11:34:51Z","snapshot_observed_at":"2026-08-03T09:32:16.807759Z","submitted_at":"2026-05-12T16:41:09Z","title":"Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-19T16:48:20.132240Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2605.12374"},"observation_digest":"sha256:f464fa9963b8e22d70baa43336492296de51a7945072ad65f9e0794bc89ecada","observation_id":"9d712c1f-6f9c-4c16-9dd3-93ba990c25ac","resolution":{"observed_at":"2026-05-21T06:39:04.582456Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2605.12374","last_updated":"2026-05-25T11:34:51Z","snapshot_observed_at":"2026-08-03T09:32:16.807759Z","submitted_at":"2026-05-12T16:41:09Z","title":"Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-21T08:02:00.980836Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2605.12374"},"observation_digest":"sha256:63c16c9677e1909b018be31c612d8c31f1e8d7b9222bd83190a92601c38e0286","observation_id":"2e67ee28-9c86-4962-8d63-9724d2eb1219","resolution":{"observed_at":"2026-05-21T08:04:02.643856Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2605.15514","last_updated":"2026-05-15T01:16:16Z","snapshot_observed_at":"2026-08-02T14:59:47.103906Z","submitted_at":"2026-05-15T01:16:16Z","title":"RoPE Distinguishes Neither Positions Nor Tokens in Long Contexts, Provably","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-19T15:34:09.006815Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2605.15514"},"observation_digest":"sha256:d96bce7e3a32210931cdab311e82336975c3b10dffc583bac395248c06b763cf","observation_id":"9ef6ed24-fbce-4efd-9698-acf9f77f0782","resolution":{"observed_at":"2026-05-21T06:39:04.582456Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2605.17887","last_updated":"2026-05-18T05:53:09Z","snapshot_observed_at":"2026-07-06T23:28:50.117638Z","submitted_at":"2026-05-18T05:53:09Z","title":"Attention Sinks and Outliers in Attention Residuals","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T12:12:20.271730Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2605.17887"},"observation_digest":"sha256:c9b1598171f728e83eef3f174addfbae3f8dc412b1c625ab66f123e03b00ca10","observation_id":"621d9bdd-1780-4161-90ea-c36599257c45","resolution":{"observed_at":"2026-05-21T06:39:04.582456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2605.18855","last_updated":"2026-05-13T16:05:30Z","snapshot_observed_at":"2026-07-06T23:29:38.069295Z","submitted_at":"2026-05-13T16:05:30Z","title":"Delta Attention Residuals","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-20T20:55:29.257097Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2605.18855"},"observation_digest":"sha256:5cc3e17e383d05bac6f9006e380e2fac5bd9a14fe6facd132b8d768f10629d66","observation_id":"9219be97-0eaa-4668-813a-dce777a30f0b","resolution":{"observed_at":"2026-05-21T06:39:04.582456Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2605.20708","last_updated":"2026-06-16T17:19:08Z","snapshot_observed_at":"2026-07-06T23:31:13.042581Z","submitted_at":"2026-05-20T05:07:15Z","title":"Rethinking Cross-Layer Information Routing in Diffusion Transformers","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-21T05:29:19.111071Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2605.20708"},"observation_digest":"sha256:66418f6da82b9909ea5a41980a9a0f7007f44644ddc0b46bb69e51f714c1ed13","observation_id":"82539a73-f1a1-4285-a021-fedc949d7f9d","resolution":{"observed_at":"2026-05-21T06:39:04.582456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2605.20708","last_updated":"2026-06-16T17:19:08Z","snapshot_observed_at":"2026-07-06T23:31:13.042581Z","submitted_at":"2026-05-20T05:07:15Z","title":"Rethinking Cross-Layer Information Routing in Diffusion Transformers","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-30T17:50:22.258541Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2605.20708"},"observation_digest":"sha256:0e2655404043982f3ae3c9d65e747ace1509b81632c7c879deba7c416b171eae","observation_id":"e84bdd41-b878-4042-a520-1ee7241d5b8f","resolution":{"observed_at":"2026-06-30T17:54:57.929350Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2605.20798","last_updated":"2026-05-20T06:43:34Z","snapshot_observed_at":"2026-08-02T17:01:43.729235Z","submitted_at":"2026-05-20T06:43:34Z","title":"Most Transformer Modifications Still Do Not Transfer at 1-3B: A 2020-2026 Update to Narang et al. (2021) with Downstream Evaluation and a Noise Floor","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-21T06:15:47.451870Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2605.20798"},"observation_digest":"sha256:bc68510848304fca85d5a9b92d5ed57ef067b7a88605f1148e8d0f4961476985","observation_id":"c7cdbabd-233f-45ff-8e08-9efbf41bcddb","resolution":{"observed_at":"2026-05-21T06:39:04.582456Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2605.23259","last_updated":"2026-05-22T06:00:39Z","snapshot_observed_at":"2026-08-02T04:25:00.903479Z","submitted_at":"2026-05-22T06:00:39Z","title":"Multi-Gate Residuals","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-25T04:48:06.164938Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2605.23259"},"observation_digest":"sha256:f05564087aef7e21dd1816daa3a06875b9777fd0fe4b8305bb6ae3adb3354b59","observation_id":"4efe9a48-8743-4e08-898c-bffdaa527ebd","resolution":{"observed_at":"2026-05-25T04:50:20.366098Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2605.25518","last_updated":"2026-05-25T07:20:13Z","snapshot_observed_at":"2026-07-06T23:35:26.687529Z","submitted_at":"2026-05-25T07:20:13Z","title":"Cross-Stage Attention Multi-Expert Network for Radiologist-Inspired Breast Ultrasound Diagnosis","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T22:26:30.257219Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2605.25518"},"observation_digest":"sha256:7fb0ee2e89bc6c7dbee63dcbd3695f5e8214a9deabc615e9d47e0855d65472d4","observation_id":"2b6441e2-1733-4700-b1bc-86a5ad3a9f4d","resolution":{"observed_at":"2026-06-29T22:34:02.164157Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2605.25704","last_updated":"2026-05-25T11:02:05Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T11:02:05Z","title":"PowLU: An Activation Function for Stable Pre-Training of LLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T21:48:45.339523Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2605.25704"},"observation_digest":"sha256:67926eedc7520518bde982c8eb5a3a62c71baf910d62d7290731db5ffbed76c5","observation_id":"e491433f-a1ca-4ed9-9b7e-dc546b46bf81","resolution":{"observed_at":"2026-06-29T21:53:59.435252Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2605.28384","last_updated":"2026-05-27T12:21:28Z","snapshot_observed_at":"2026-08-01T10:47:24.351788Z","submitted_at":"2026-05-27T12:21:28Z","title":"Meta-Attention: Bayesian Per-Token Routing for Efficient Transformer Inference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T14:44:08.335157Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2605.28384"},"observation_digest":"sha256:e6666a03f0967901671705fd1b8581d49d1e2cd933572db00749f570c571b2e5","observation_id":"afe420c4-4786-4d39-a94b-9f1e54565cb2","resolution":{"observed_at":"2026-06-29T14:53:31.440246Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2605.29351","last_updated":"2026-05-28T04:44:31Z","snapshot_observed_at":"2026-07-06T23:38:46.361360Z","submitted_at":"2026-05-28T04:44:31Z","title":"Attention as In-Context Empirical Bayes: A Two-Stage View via Particle Dynamics","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-29T09:03:28.566205Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2605.29351"},"observation_digest":"sha256:5a95ccec7cfb7f9b52400655d76311ea256f66e147de575b6c69d6d96c1854be","observation_id":"0404ab68-b90f-4392-be4f-dbf383816540","resolution":{"observed_at":"2026-06-29T09:13:16.369635Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2606.02780","last_updated":"2026-07-18T16:18:38Z","snapshot_observed_at":"2026-08-02T12:41:17.637289Z","submitted_at":"2026-06-01T18:43:34Z","title":"Do Value Vectors in Deep Layers Need Context from the Residual Stream?","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-06-28T14:35:48.292081Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2606.02780"},"observation_digest":"sha256:5121684128531cc21f2ca2aa958c00342f88ce50c43503deaecc55f69c3e3474","observation_id":"7657c6ec-a4f5-42c3-99bc-9d24218f16f2","resolution":{"observed_at":"2026-07-01T23:16:23.393310Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-08-02T12:41:21.055096Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.02780","last_updated":"2026-07-18T16:18:38Z","snapshot_observed_at":"2026-08-02T12:41:17.637289Z","submitted_at":"2026-06-01T18:43:34Z","title":"Do Value Vectors in Deep Layers Need Context from the Residual Stream?","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-02T12:41:21.055096Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2606.02780"},"observation_digest":"sha256:7ff4a9e3d603e6cf3400fb71ed597dbf81c109eb8085ead83ef58bbb2cc74583","observation_id":"ea5ed3be-83a3-4e99-8d8f-ed8f5f91111f","resolution":{"observed_at":"2026-08-02T12:41:21.055096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2606.04445","last_updated":"2026-06-03T04:47:38Z","snapshot_observed_at":"2026-08-01T15:16:31.115911Z","submitted_at":"2026-06-03T04:47:38Z","title":"RowNet: A Memory Transformer for Tabular Regression","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T07:16:34.310531Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2606.04445"},"observation_digest":"sha256:af999c9e4e9aa2eb4838b3f5b69d6e0feb82b5b3e802e9285929f2323da5b124","observation_id":"e81a4f83-eff6-4946-bf0b-ed4ea8637247","resolution":{"observed_at":"2026-07-02T06:56:44.711940Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2606.05014","last_updated":"2026-06-03T15:33:45Z","snapshot_observed_at":"2026-07-06T23:45:02.342193Z","submitted_at":"2026-06-03T15:33:45Z","title":"Depth-Attention: Cross-Layer Value Mixing for Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T05:52:27.274577Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2606.05014"},"observation_digest":"sha256:ab14bcc023f031f2bafa731763025acc4bbcadeaa6883113f3ca9aaeba0bf80c","observation_id":"221b1ff3-3f91-41a2-b9cf-6d71cc359f08","resolution":{"observed_at":"2026-07-02T08:36:48.492882Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2606.06564","last_updated":"2026-06-17T07:56:14Z","snapshot_observed_at":"2026-08-01T19:51:34.367586Z","submitted_at":"2026-06-04T16:15:27Z","title":"HAARES Half-Split Residual Basis Routing for Deep Transformers","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-28T03:12:38.612580Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2606.06564"},"observation_digest":"sha256:ca83b2d64f9afa63aa2d3df7a6f44660e9b9437c20cd9a7d883f59f7ce26598b","observation_id":"dfba7ea8-a132-444a-9d29-691d2e009aae","resolution":{"observed_at":"2026-07-02T11:36:55.418977Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2606.07980","last_updated":"2026-06-06T05:07:16Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T05:07:16Z","title":"DeRes: Decoupling Residual Stability and Adaptivity for Scalable CTR Prediction","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:00.412682Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2606.07980"},"observation_digest":"sha256:efc21f6cd61f505f52fea3b10c08c08f27df9cc3f1178edfda90993d91d42ae2","observation_id":"f26a50ab-71bd-476f-9e2d-18de8415f6fd","resolution":{"observed_at":"2026-07-02T21:57:25.811326Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:1b9c517af7a8cae7ed07211cc55dc549c9bdd95fe3c54c9f7f73178d895994bc","observation_id":"ea5a36e1-cc8a-46e7-87dc-23c50209f99a","resolution":{"observed_at":"2026-07-02T20:47:23.055792Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2606.18246","last_updated":"2026-06-16T17:59:03Z","snapshot_observed_at":"2026-08-02T16:01:00.670614Z","submitted_at":"2026-06-16T17:59:03Z","title":"Variable-Width Transformers","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-27T00:57:22.872902Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2606.18246"},"observation_digest":"sha256:d94cb14fef63f608e6094ac8374fc84cdf27924a82162ce2b06a003b95abdf8c","observation_id":"48a47edb-8808-42dd-89c4-f8b7ca3901ae","resolution":{"observed_at":"2026-07-03T20:58:58.601724Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2606.22325","last_updated":"2026-06-21T03:59:13Z","snapshot_observed_at":"2026-08-05T01:06:18.294498Z","submitted_at":"2026-06-21T03:59:13Z","title":"All Routes Lead to Collapse","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-26T11:08:04.684046Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2606.22325"},"observation_digest":"sha256:7bbb72ecd4e459792a92ad767a1e58ee286f032f242402ba50d4a66ee89106cc","observation_id":"0af3eaa5-f195-4700-ba68-f74e05297c00","resolution":{"observed_at":"2026-07-04T08:39:42.444991Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2606.25008","last_updated":"2026-06-23T17:46:30Z","snapshot_observed_at":"2026-07-31T03:01:22.674756Z","submitted_at":"2026-06-23T17:46:30Z","title":"Neural Scaling Universality: If Exponents Are Fixed, Time to Understand Coefficients","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-25T23:45:54.283436Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2606.25008"},"observation_digest":"sha256:348cb9f09ded54396a3b817067590875221a6925c35d62cfc5b467ff5d6f8f22","observation_id":"db5a468d-17d8-4d64-9199-138877cb7e7e","resolution":{"observed_at":"2026-07-04T17:20:00.906151Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2606.27243","last_updated":"2026-07-28T15:00:22Z","snapshot_observed_at":"2026-08-02T10:04:06.730634Z","submitted_at":"2026-06-25T16:30:39Z","title":"NOVA: A Verification-Aware Agent Harness for Architecture Evolution in Industrial Recommender Systems","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T02:04:28.116688Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2606.27243"},"observation_digest":"sha256:c497df573948f1a86a58c1d83c3caa6bbc2865dc8c13f4ff767bd13f0f63d90f","observation_id":"d7841a03-dc36-49cb-b249-c590b944bc46","resolution":{"observed_at":"2026-07-04T14:59:55.453169Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2606.27243","last_updated":"2026-07-28T15:00:22Z","snapshot_observed_at":"2026-08-02T10:04:06.730634Z","submitted_at":"2026-06-25T16:30:39Z","title":"NOVA: A Verification-Aware Agent Harness for Architecture Evolution in Industrial Recommender Systems","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T05:03:27.505370Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2606.27243"},"observation_digest":"sha256:4f4195c1563f517139ba9d05a52bd4e99d218a07842d3ac2efb0dc2f93eede49","observation_id":"c400cd70-cbc7-4eaf-ba85-00f9d0a1e57b","resolution":{"observed_at":"2026-06-29T18:43:51.173056Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-08-02T10:04:09.464805Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.27243","last_updated":"2026-07-28T15:00:22Z","snapshot_observed_at":"2026-08-02T10:04:06.730634Z","submitted_at":"2026-06-25T16:30:39Z","title":"NOVA: A Verification-Aware Agent Harness for Architecture Evolution in Industrial Recommender Systems","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T10:04:09.464805Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2606.27243"},"observation_digest":"sha256:5127382794e52170d15751ed5577df3fba78ad69827b53070c8d71c6416e08f8","observation_id":"187bf93e-c3e0-48c2-9dc4-d1d6db4e16c3","resolution":{"observed_at":"2026-08-02T10:04:09.464805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2606.28116","last_updated":"2026-06-26T14:18:22Z","snapshot_observed_at":"2026-07-07T00:02:14.441610Z","submitted_at":"2026-06-26T14:18:22Z","title":"Mechanism-Driven Monitors for Preemptive Detection of LLM Training Instability","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T04:08:37.263436Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2606.28116"},"observation_digest":"sha256:9cbaa601e92953c1bd6c393632915668f3684a1e9c8c3f121b666093412896d0","observation_id":"d9649c61-ea17-4f2d-b179-295f764b3bd8","resolution":{"observed_at":"2026-07-01T17:15:50.562998Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2606.31859","last_updated":"2026-06-30T15:53:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-30T15:53:27Z","title":"Review Residuals: Update-Conditioned Residual Gating for Transformers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-01T06:38:06.546686Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2606.31859"},"observation_digest":"sha256:9a0ef61a9d69f884816bfb864807cde253fab9030af2c708db450a0d343d612c","observation_id":"c2768088-cf49-4618-ae8a-4de1e55e6b49","resolution":{"observed_at":"2026-07-01T06:45:29.870361Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-11T13:03:39.236118Z","title":"2026 , archiveprefix =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-04T15:17:53.147491Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-07-11T13:03:39.236118Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:e016777b6de0775eff5c5300f914a78f22fe609fc4e1c29e695f6214d8420a81","observation_id":"ab8fea19-ddf3-436f-b3e2-e544993e1d48","resolution":{"observed_at":"2026-07-11T13:03:39.236118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"2026 , archiveprefix =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-04T15:17:53.147491Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:d19d4eb2cec2a51de3da7aeeac51faad76b267b2eaec3a586dce2cf8ae7702d7","observation_id":"9485afba-2355-4535-b4ed-09cec240ec37","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2607.07953","last_updated":"2026-07-08T22:14:14Z","snapshot_observed_at":"2026-08-02T14:25:03.529897Z","submitted_at":"2026-07-08T22:14:14Z","title":"Linear Attention Architectures: Mechanisms, Trade-offs, and Cross-Layer Routing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-10T14:48:23.587464Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2607.07953"},"observation_digest":"sha256:12b165bad7410607455008cd60864acf7c1d4a4b29870210d42516445cdcb0e6","observation_id":"8aab5da6-f6fe-40f9-ba9b-85a8fabd0508","resolution":{"observed_at":"2026-07-10T14:57:14.485595Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-10T14:57:14.484456Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2607.08545","last_updated":"2026-07-09T14:38:16Z","snapshot_observed_at":"2026-07-12T23:18:50.564044Z","submitted_at":"2026-07-09T14:38:16Z","title":"Structural Bottlenecks on Frequency Representation in End-to-End Audio Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-10T05:37:12.972599Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2607.08545"},"observation_digest":"sha256:67750082ccd4c9f7c3cc26d9963644330447f500006e950a406b8e81e20e5cde","observation_id":"bd9cdf6b-2d0b-4013-b5c8-9889a457b6f1","resolution":{"observed_at":"2026-07-10T05:46:50.396849Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-14T17:37:51.504123Z","title":"11 Preprint Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.09694","last_updated":"2026-06-19T13:27:19Z","snapshot_observed_at":"2026-08-02T07:55:28.351393Z","submitted_at":"2026-06-19T13:27:19Z","title":"Low-Rank Attention Residuals","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T17:37:51.504123Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2607.09694"},"observation_digest":"sha256:74239d5ba305a9b376d01267ed9b86130bd3bb96f5d4692d5e096987524f4e45","observation_id":"bf92659f-fb94-48bf-802b-07593fadec71","resolution":{"observed_at":"2026-07-14T17:37:51.504123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-08-02T01:53:17.306868Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14530","last_updated":"2026-07-16T03:31:03Z","snapshot_observed_at":"2026-08-03T03:22:41.040536Z","submitted_at":"2026-07-16T03:31:03Z","title":"xHC: Expanded Hyper-Connections","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T01:53:17.306868Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2607.14530"},"observation_digest":"sha256:dc411aa46f22dd718d354b8d3a74240c2bffab52b3290bbc3171d7fd7f5678d8","observation_id":"daa1b5dd-535e-4667-a329-e4f6578046fb","resolution":{"observed_at":"2026-08-02T01:53:17.306868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-08-01T16:19:08.171765Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18363","last_updated":"2026-07-20T15:29:00Z","snapshot_observed_at":"2026-08-01T16:19:07.506070Z","submitted_at":"2026-07-20T15:29:00Z","title":"A Controlled Study of Attention-Only Transformers","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T16:19:08.171765Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2607.18363"},"observation_digest":"sha256:7e18b8b8ab11f57f0d0c6a5b0859beefce33325ba278f53ca1a7e4fe716bce6a","observation_id":"7a5f1240-2c4a-4bc0-b1a2-64068c2353d8","resolution":{"observed_at":"2026-08-01T16:19:08.171765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-08-01T14:36:36.160565Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18730","last_updated":"2026-07-21T05:42:55Z","snapshot_observed_at":"2026-08-02T19:31:53.713270Z","submitted_at":"2026-07-21T05:42:55Z","title":"Dual Attention Residuals","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-01T14:36:36.160565Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2607.18730"},"observation_digest":"sha256:e6789868719e392b39824879ea86d9bfa4db6809d5dd427971febbcf5320caa3","observation_id":"f6de9292-5daf-48eb-89fd-f0a142ac9f1b","resolution":{"observed_at":"2026-08-01T14:36:36.160565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-08-01T07:09:05.956746Z","title":"Attention Residuals","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T22:42:28.999422Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:05.956746Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:758cbfcf57093713956de4870f5a80bc18dfde329a4348b18575824dda4f5977","observation_id":"022e5892-adbc-4a92-9637-75959bf95652","resolution":{"observed_at":"2026-08-01T07:09:05.956746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-08-01T05:43:51.525154Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22136","last_updated":"2026-07-24T09:30:57Z","snapshot_observed_at":"2026-08-01T05:43:47.142106Z","submitted_at":"2026-07-24T09:30:57Z","title":"Dynamic Commonsense Coordination for Empathetic Response Generation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-01T05:43:51.525154Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2607.22136"},"observation_digest":"sha256:6be9abde06fa75ee0023c436d83d1a58050dfa6f0799607c0119eeae43c2d8c0","observation_id":"234cd3f0-8fc0-4355-8d8b-edae69b2f58d","resolution":{"observed_at":"2026-08-01T05:43:51.525154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-08-01T03:02:01.365825Z","title":"and Meng, Fanqing and Hong, Chao and Xie, Xiaotong and Liu, Shaowei and Lu, Enzhe and Tai, Yunpeng and Chen, Yanru and Men, Xin and Guo, Haiqing and Charles, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25271","last_updated":"2026-07-28T04:18:49Z","snapshot_observed_at":"2026-08-03T13:49:38.726720Z","submitted_at":"2026-07-28T04:18:49Z","title":"Bridging Compute- and Data-Optimal Pretraining","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-01T03:02:01.365825Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2607.25271"},"observation_digest":"sha256:ad52e27be87eb75a96c8b23f01bf0488bafa3f93da579b4fc548aefb3489d99c","observation_id":"884647fb-dbc4-4bee-86c7-a51580a41cd6","resolution":{"observed_at":"2026-08-01T03:02:01.365825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-08-01T11:39:22.850069Z","title":"Finepdfs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-05T01:15:48.863534Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-01T11:39:22.850069Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:83b1265c797e4d0bcd7cdd545dec413468a5aa97f61ed950c2d7c574e26566cb","observation_id":"abada9b0-c345-401e-81c2-4b4ba4b46d68","resolution":{"observed_at":"2026-08-01T11:39:22.850069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-08-04T01:39:47.872763Z","title":"Finepdfs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-05T01:15:48.863534Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:47.872763Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:deac2588afa93b371b155a7837679f81056e693e9341ace1700de84f87518688","observation_id":"bd5aa1d8-db5a-42db-a10d-2648fef6ea78","resolution":{"observed_at":"2026-08-04T01:39:47.872763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2603.15031/citation-record","integrity":"/paper/2603.15031/integrity","json":"/paper/2603.15031/citation-record.json","paper":"/paper/2603.15031"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":"2108.07732","doi":"10.1007/s11390-025-5518-5","metadata_source":"pith","pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Program Synthesis with Large Language Models","venue":"cs.PL","work_id":"fd241a05-03b9-4de2-9588-9d77ce176125","year":2021},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:099943d52d5da483a8998219a402c651bff3ec3e6262013e06a833672a3922e7","observation_id":"2b40efc6-40ad-489e-9f48-e6740dc679d1","resolution":{"observed_at":"2026-05-21T06:39:04.414073Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.04887","last_updated":"2020-06-25T00:09:04Z","snapshot_observed_at":"2026-07-06T09:03:43.967832Z","submitted_at":"2020-03-10T17:58:01Z","title":"ReZero is All You Need: Fast Convergence at Large Depth","version":2},"cited_work":{"arxiv_id":"2003.04887","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2003.04887","snapshot_observed_at":"2026-07-04T05:29:36.294672Z","title":"org/abs/2003.04887","venue":null,"work_id":"b42ba283-db4c-4750-8093-4c7899caf3ea","year":2020},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2003.04887","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:ef90dac19dcefe8d10b5da19a511b974d2404da3746ced587e19c80dd42c435f","observation_id":"6192be48-d836-4a44-82bd-1269e536e205","resolution":{"observed_at":"2026-05-21T06:39:04.417303Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.0473","last_updated":"2016-05-19T21:53:22Z","snapshot_observed_at":"2026-07-06T03:53:10.336430Z","submitted_at":"2014-09-01T16:33:02Z","title":"Neural Machine Translation by Jointly Learning to Align and Translate","version":7},"cited_work":{"arxiv_id":"1409.0473","doi":"10.48550/arxiv.1409.0473","metadata_source":"pith","pith_arxiv_id":"1409.0473","snapshot_observed_at":"2026-07-10T19:07:35.054881Z","title":"Neural Machine Translation by Jointly Learning to Align and Translate","venue":"cs.CL","work_id":"d831e763-d530-4029-a65c-ac595d82cb2a","year":2014},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/1409.0473","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:2bb4963de88905a325f567f4f8342c90c31ea34928154a870a7baf4451503e08","observation_id":"441d28d2-2bf6-495f-bc8c-0ce070ed4713","resolution":{"observed_at":"2026-05-21T06:39:04.358924Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-16T23:20:48.784513+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-16T23:20:48.784513+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.19895","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:03:56.353248Z","title":"Post-layernorm is back: Stable, expressive, and deep.arXiv preprint arXiv:2601.19895, 2026","venue":null,"work_id":"c209a9c2-f39e-44f1-a5e9-40481812071c","year":2026},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:0e228651bf56fdf0814f0cb156f6295e400cbac349e9975732e7dd09e6bf14eb","observation_id":"ededb4f2-dc48-44ff-bb08-78658201357b","resolution":{"observed_at":"2026-05-21T06:39:04.363263Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-07-11T03:27:46.202228Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:73f484317e237ef42c53a6b108cfc75ae50e5ccb72f4719c1243f01e899afa26","observation_id":"298f89b3-fe04-4f1f-be33-62f707f41c61","resolution":{"observed_at":"2026-05-21T06:39:04.367229Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:37a33b6929b43481d0f51586723da7923520e8092da359f99a505313b14492f1","observation_id":"4c65da4f-74cf-4e26-bdad-90bce18a2991","resolution":{"observed_at":"2026-05-21T06:39:04.371259Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:8391c54507380972fc0f18e1d64305d15ad0f99230f09afadc4bb880b4d101db","observation_id":"22cb02d3-6414-4b9f-85e3-f362739900ae","resolution":{"observed_at":"2026-05-21T06:39:04.375096Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":"2405.21060","doi":"10.48550/arxiv.2405.21060","metadata_source":"pith","pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-07-10T21:57:38.573725Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","venue":"cs.LG","work_id":"d8eba076-0449-4f6a-aae1-5a7260677f0f","year":2024},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:a6339280535d94072ab6c84c8c585b585c9679213fc5fc5f5c468f02ff47f8cf","observation_id":"eaa4aefc-9949-4d81-8514-366f7991cb07","resolution":{"observed_at":"2026-05-21T06:39:04.348285Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:0898b114454bcd962d0e264c4388c8dfd808c8d7f7bc50717d91ddac9ffc173d","observation_id":"1052907f-dc0a-478a-9758-ce4eb7dc85ad","resolution":{"observed_at":"2026-05-21T06:39:04.379383Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03985","last_updated":"2023-02-28T06:31:09Z","snapshot_observed_at":"2026-08-01T11:26:03.548686Z","submitted_at":"2023-02-08T10:50:01Z","title":"Cross-Layer Retrospective Retrieving via Layer Attention","version":5},"cited_work":{"arxiv_id":"2302.03985","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.03985","snapshot_observed_at":"2026-07-02T20:17:21.171555Z","title":"arXiv preprint arXiv:2302.03985 , year=","venue":null,"work_id":"cc5e62f0-3f28-4fe3-97df-cfecb66ed5ff","year":2023},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2302.03985","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:21d2c1c19510cbe20abf3106ab597814194d5de443e3ffab9bc336b76b5af009","observation_id":"1f9571bd-10d7-4835-9e12-d44796c361bb","resolution":{"observed_at":"2026-05-21T06:39:04.383495Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17887","last_updated":"2025-03-03T17:02:05Z","snapshot_observed_at":"2026-08-03T06:33:46.668360Z","submitted_at":"2024-03-26T17:20:04Z","title":"The Unreasonable Ineffectiveness of the Deeper Layers","version":2},"cited_work":{"arxiv_id":"2403.17887","doi":"10.48550/arxiv.2403.17887","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.17887","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"The unreasonable ineffectiveness of the deeper layers.arXiv preprint arXiv:2403.17887","venue":null,"work_id":"93761c3c-6e0f-41d0-a8ea-17b8d13c3387","year":2024},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2403.17887","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:3cb1445f5e49998a325d62190c7c16bbedc5ae0786e1f9e0263d9fff29f86fae","observation_id":"ff7b1b89-f86b-40df-af12-51f254be6010","resolution":{"observed_at":"2026-05-21T06:39:04.388399Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1512.03385","last_updated":"2015-12-10T19:51:55Z","snapshot_observed_at":"2026-07-06T04:39:28.429064Z","submitted_at":"2015-12-10T19:51:55Z","title":"Deep Residual Learning for Image Recognition","version":1},"cited_work":{"arxiv_id":"1512.03385","doi":"10.48550/arxiv.1512.03385","metadata_source":"pith","pith_arxiv_id":"1512.03385","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Deep Residual Learning for Image Recognition","venue":"cs.CV","work_id":"ae9e5671-23e8-4853-82a4-699b5b8dd639","year":2015},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/1512.03385","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:d311f00611ca13d80374f335d88d190647ecb29bdb8a6c9315ace482ccf2f456","observation_id":"3cf8f0c0-9401-467a-972f-e16f88b08514","resolution":{"observed_at":"2026-05-21T06:39:04.391921Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-02T01:38:25.811068+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T01:38:25.811068+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-07-11T01:37:42.666395Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:ce3fb6d1782a08adf309ff3429d6de58074ca94482025c55d35735ce91a2585d","observation_id":"eb585261-4085-4d22-bce0-fa250a8adbe1","resolution":{"observed_at":"2026-05-21T06:39:04.395547Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-07-10T16:57:24.565388Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:4b1d56e4085beabb36e0833502b85451879ae5c320d75ce6cd508642156c6c0a","observation_id":"9c275e7c-2558-4265-be01-b94e0c93a0c9","resolution":{"observed_at":"2026-05-21T06:39:04.399303Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":"2203.15556","doi":"10.1098/rsta.2024.0522","metadata_source":"pith","pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Compute-Optimal Large Language Models","venue":"cs.CL","work_id":"b2faf28d-86b7-429c-bc42-469458efc246","year":2022},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:bb109643d7b50a018c0d3dce9215a406cfca8320ac65a4ece1df072acf62c6b9","observation_id":"3c54a651-213d-47e4-b5ee-cd6e50487339","resolution":{"observed_at":"2026-05-21T06:39:04.403147Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":"2404.06395","doi":"10.48550/arxiv.2404.06395","metadata_source":"pith","pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-07-11T03:07:51.226857Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","venue":"cs.CL","work_id":"f20a4304-bd39-414a-923b-d18322e29258","year":2024},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:b0184873c14fd14feec55c591e510a4f623cd5adc1f6ecda760ef8888289ed12","observation_id":"fba6b81b-42f1-4034-9df9-f837739e9134","resolution":{"observed_at":"2026-05-21T06:39:04.407227Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1608.06993","last_updated":"2018-01-28T17:12:02Z","snapshot_observed_at":"2026-08-02T15:24:04.588145Z","submitted_at":"2016-08-25T00:44:55Z","title":"Densely Connected Convolutional Networks","version":5},"cited_work":{"arxiv_id":"1608.06993","doi":"10.48550/arxiv.1608.06993","metadata_source":"pith","pith_arxiv_id":"1608.06993","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Densely Connected Convolutional Networks","venue":"cs.CV","work_id":"c5239b52-732f-4827-b3d3-018425f71005","year":2016},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/1608.06993","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:08dd4c20cba3a6bf6df95699b1d8012c6f6afb7c738f8db1f806f5c4c86651bf","observation_id":"a7bd47e2-81f2-45e9-83f8-8abd564f1bfc","resolution":{"observed_at":"2026-05-21T06:39:04.410495Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T20:19:49.632321+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T20:19:49.632321+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GPipe: Efficient Training of Giant Neural Networks using Pipeline Parallelism","venue":null,"work_id":"10bb421a-aa47-4a84-9959-d8a1addaa7d3","year":2019},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:19aa3a10e0dda9245b69738e9ac081926997ead8c9d16447f52872dda01c5a28","observation_id":"cbe0e777-25ac-4fbe-a9de-58ff0a209cf0","resolution":{"observed_at":"2026-05-21T06:39:04.538600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"C-eval: A multi-level multi-discipline chinese evaluation suite for foundation models","venue":null,"work_id":"d47ddcd0-0001-45a2-a510-7e01f98056d3","year":2023},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:10f0e175eac07bcf2709db9908046f2f04f038b92d1af118d559f3e103612708","observation_id":"e5821561-57e1-4e0d-8c4e-f08d993c508f","resolution":{"observed_at":"2026-05-21T06:39:04.536284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1162/neco.1991.3.1.79","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:43:50.231909Z","title":"Adaptive Mixtures of Local Experts","venue":null,"work_id":"34d9cc50-d973-4e6d-9d1d-a9a0b84608aa","year":1991},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:0c7b771c8cf19637d2022be15dd5c77a4981cb2f964b22e9c3e2e14886ed2eca","observation_id":"2a65cd8e-770e-469f-b59c-a1a68290af71","resolution":{"observed_at":"2026-05-21T06:39:04.353617Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-03T22:08:40.525684+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T22:08:40.525684+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.03551","last_updated":"2017-05-13T21:12:37Z","snapshot_observed_at":"2026-08-02T11:13:42.401488Z","submitted_at":"2017-05-09T21:35:07Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension","version":2},"cited_work":{"arxiv_id":"1705.03551","doi":"10.48550/arxiv.1705.03551","metadata_source":"pith","pith_arxiv_id":"1705.03551","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension","venue":"cs.CL","work_id":"f20e62ba-6265-4b97-aa8c-ddefaf2f5762","year":2017},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/1705.03551","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:e27f2417e30c857440a61d0ba33b67ed7504bcc3d36762519b3de3d83617df1a","observation_id":"f43166e5-3335-48d5-9a59-31f9f092a2c4","resolution":{"observed_at":"2026-05-21T06:39:04.491412Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":"2001.08361","doi":"10.1145/3616855.3635845","metadata_source":"pith","pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Scaling Laws for Neural Language Models","venue":"cs.LG","work_id":"b7dd8749-9c45-4977-ab9b-64478dce1ae8","year":2020},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:6a9fa9f07bbbd6376dce58c74b210a942d7a71f3b0e6e73cd0752885ee52845f","observation_id":"cc01e81b-79f2-4d9f-bf89-8be890b07c00","resolution":{"observed_at":"2026-05-21T06:39:04.494310Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","venue":null,"work_id":"98408f02-9bc3-4c68-ac85-50e78f4f51ea","year":2020},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:9a992df4d51fbd8da0a9a7aff000fe803892adca3f5bd34fd462a4b7578bf479","observation_id":"b9ad86b0-945e-46b9-acdc-d45f87a2d678","resolution":{"observed_at":"2026-05-21T06:39:04.545283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.21582","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T08:36:48.498769Z","title":"Depth-recurrent attention mixtures: Giving latent reasoning the attention it deserves.CoRR, abs/2601.21582","venue":null,"work_id":"6de00274-8ff7-4c35-befc-bb1d1d5db521","year":2026},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:323d6d8f9ee5503aeb5d0bb45ebd11117ca6067307f4f4727f044338fb7a8de2","observation_id":"5d1e8bd1-54ea-408c-8c8d-567693eb4a27","resolution":{"observed_at":"2026-05-21T06:39:04.497855Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.14858","last_updated":"2022-07-01T02:15:12Z","snapshot_observed_at":"2026-07-06T13:26:06.337115Z","submitted_at":"2022-06-29T18:54:49Z","title":"Solving Quantitative Reasoning Problems with Language Models","version":2},"cited_work":{"arxiv_id":"2206.14858","doi":"10.48550/arxiv.2206.14858","metadata_source":"pith","pith_arxiv_id":"2206.14858","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Solving Quantitative Reasoning Problems with Language Models","venue":"cs.CL","work_id":"17214d12-1ca8-4186-806d-53c6715383a0","year":2022},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2206.14858","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:f252a6a56a7b21159ce4cb13ee70ea3a3acee66b987d56ad48f60011afbb1e03","observation_id":"a7b4be31-3d19-483a-8913-66bb55cd7d0e","resolution":{"observed_at":"2026-05-21T06:39:04.500945Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-21T13:53:28.356363+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T13:53:28.356363+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CMMLU: Measuring massive multitask language understanding in Chinese","venue":null,"work_id":"cae29c8d-40b0-437e-82fc-d63120cfde46","year":2024},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:77d20b18b92dc40ecde2623370a72bae66bff4b216d62f1a12ac4c3a3e5edf7e","observation_id":"c1da32fa-d478-41c9-a6b0-bf01374ac6ce","resolution":{"observed_at":"2026-05-21T06:39:04.551883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.08064","last_updated":"2026-05-21T09:52:18Z","snapshot_observed_at":"2026-08-04T01:56:43.373244Z","submitted_at":"2026-02-08T17:17:56Z","title":"SiameseNorm: Breaking the Barrier to Reconciling Pre/Post-Norm","version":2},"cited_work":{"arxiv_id":"2602.08064","doi":"10.48550/arxiv.2602.08064","metadata_source":"pith","pith_arxiv_id":"2602.08064","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"SiameseNorm: Breaking the Barrier to Reconciling Pre/Post-Norm","venue":"cs.LG","work_id":"b9469b65-c74d-4c3e-84e8-2f5123d8ba3a","year":2026},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2602.08064","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:e5a3941190d9cdf293423df7f810fded6fdcc362c36ef5bedd2f7d224e922f4d","observation_id":"3bbd3c27-48c8-4ae0-b5de-5ca19a13a636","resolution":{"observed_at":"2026-05-22T02:03:55.284213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:27.537285+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:27.537285+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-07-10T21:57:38.615639Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:551a61090d0e27d72a8046522c672520c8171b7447255eac5ff38a424fa125a7","observation_id":"9d93a0da-45d1-4a23-be1a-c0325b060e90","resolution":{"observed_at":"2026-05-21T06:39:04.506714Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22696","last_updated":"2025-06-28T00:29:42Z","snapshot_observed_at":"2026-07-06T21:48:59.271767Z","submitted_at":"2025-06-28T00:29:42Z","title":"Residual Matrix Transformers: Scaling the Size of the Residual Stream","version":1},"cited_work":{"arxiv_id":"2506.22696","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22696","snapshot_observed_at":"2026-07-02T01:56:27.336351Z","title":"arXiv preprint arXiv:2506.22696 , year=","venue":null,"work_id":"076bb49f-d976-49de-92a3-360db9563d2d","year":2025},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2506.22696","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:5ffd159b01e2c4d03c0943677c7497655188ed3aed7497be25189e0ed3797c61","observation_id":"05bcf0ab-3cf0-47aa-b7c8-e760f495da94","resolution":{"observed_at":"2026-05-21T06:39:04.510323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07501","last_updated":"2025-06-24T04:11:06Z","snapshot_observed_at":"2026-07-06T19:48:49.553384Z","submitted_at":"2024-11-12T02:57:15Z","title":"LAuReL: Learned Augmented Residual Layer","version":4},"cited_work":{"arxiv_id":"2411.07501","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.07501","snapshot_observed_at":"2026-07-02T08:36:48.488774Z","title":"Laurel: Learned augmented residual layer","venue":null,"work_id":"0c1bd2ee-f236-4997-ad67-fc5e201c82c4","year":2025},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2411.07501","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:2d587ae8c3baf7c19ade6595d19ad7919c802d2d3a7a122026f6da8aa3dca688","observation_id":"4c05a788-6b43-40ce-a24f-89dad17f10a4","resolution":{"observed_at":"2026-05-21T06:39:04.513150Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.02867","last_updated":"2018-07-28T06:51:27Z","snapshot_observed_at":"2026-07-06T06:37:55.065033Z","submitted_at":"2018-05-08T07:34:17Z","title":"Online normalizer calculation for softmax","version":2},"cited_work":{"arxiv_id":"1805.02867","doi":null,"metadata_source":"pith","pith_arxiv_id":"1805.02867","snapshot_observed_at":"2026-07-04T17:50:00.641865Z","title":"Online normalizer calculation for softmax","venue":"cs.PF","work_id":"69eba45e-8338-46b7-b28a-e99bb687af56","year":2018},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/1805.02867","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:34ec2e15aae5cdc45d10701127c031e07f678a3d0040fbf948cf7738ed921d99","observation_id":"da0a0c19-131f-4565-8cfd-6efbe6d13113","resolution":{"observed_at":"2026-05-21T06:39:04.516032Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.09720","last_updated":"2019-12-03T14:16:23Z","snapshot_observed_at":"2026-08-05T00:32:53.544892Z","submitted_at":"2019-07-23T07:04:07Z","title":"Metalearned Neural Memory","version":2},"cited_work":{"arxiv_id":"1907.09720","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1907.09720","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Metalearned Neural Memory","venue":null,"work_id":"c6e64cbc-22be-4cb1-b807-c85615fcee16","year":1907},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/1907.09720","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:c88e6cf5bb4a00a95609913ce29fb9a6459470a8f7216d2b98b29d4378f68fda","observation_id":"2d3fe499-5d4a-4c55-b97b-fc4e3490448e","resolution":{"observed_at":"2026-05-21T06:39:04.519193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"51b4eb2c-af25-46db-9ed9-095133c7f527","year":null},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:93773ef88887e61c3446c7e396333cccd1d50014df4b80ee4198da1899e41909","observation_id":"648c3699-64ee-46e6-beaf-c2a90114c946","resolution":{"observed_at":"2026-05-21T06:39:04.568145Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-05T01:25:49.519251Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":"2104.04473","doi":"10.48550/arxiv.2104.04473","metadata_source":"pith","pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Efﬁcient large-scale language model training on gpu clusters using megatron-lm","venue":"cs.CL","work_id":"cb405716-f30a-4004-aef0-12f4f12f0e20","year":2021},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:1e414d277570b6aefdfec9300a4eeb95c9eda4a5cbc810fc3e93e8b0b599233b","observation_id":"177b40ef-d995-4946-a80f-645b9db7e617","resolution":{"observed_at":"2026-05-21T06:39:04.522153Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformers without Tears: Improving the Normalization of Self- Attention","venue":null,"work_id":"05630f8b-3cd0-43ea-90e4-d0829274c5bb","year":2019},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:6c525e7ebe357bb5912153ad7f7576d98b5c0a7be33b618620c4544a80249e4e","observation_id":"62c77ddd-34c1-4a51-be84-840a1cf4f093","resolution":{"observed_at":"2026-05-21T06:39:04.572929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:45eb4fab28e4c9f65e6c1844e5f0228884138cb1cb440ae976fd6e43e47745f7","observation_id":"f926db98-2322-4bfd-bfe9-6a25db0a2e67","resolution":{"observed_at":"2026-05-21T06:39:04.524846Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02622","last_updated":"2024-03-21T10:57:40Z","snapshot_observed_at":"2026-08-02T10:12:33.502982Z","submitted_at":"2024-02-04T21:44:09Z","title":"DenseFormer: Enhancing Information Flow in Transformers via Depth Weighted Averaging","version":2},"cited_work":{"arxiv_id":"2402.02622","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.02622","snapshot_observed_at":"2026-07-01T23:16:23.506342Z","title":"arXiv:2402.02622 , year =","venue":null,"work_id":"c6ab3d0d-d6a8-4adc-8248-3fcd4c431631","year":2024},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2402.02622","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:d17dd60c158573e1ee5fb6a70c07e3c7f497535e48194a45537ae33053dd448d","observation_id":"752dd56c-7ae3-4437-a519-c162639bf238","resolution":{"observed_at":"2026-05-21T06:39:04.527752Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00071","last_updated":"2026-02-06T19:40:50Z","snapshot_observed_at":"2026-08-01T02:15:47.181936Z","submitted_at":"2023-08-31T18:18:07Z","title":"YaRN: Efficient Context Window Extension of Large Language Models","version":3},"cited_work":{"arxiv_id":"2309.00071","doi":"10.48550/arxiv.2309.00071","metadata_source":"pith","pith_arxiv_id":"2309.00071","snapshot_observed_at":"2026-07-10T20:07:33.546647Z","title":"YaRN: Efficient Context Window Extension of Large Language Models","venue":"cs.CL","work_id":"31f454a9-7de2-4696-86f2-9bfa1410f80d","year":2023},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2309.00071","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:f7b085c6811751b93550d81cbd845e042bcecd999991e69674fad2364f815566","observation_id":"583e6877-fd89-4618-9fbd-26abe815a444","resolution":{"observed_at":"2026-05-21T06:39:04.530763Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep Contextualized Word Representations","venue":null,"work_id":"2138bc65-fcee-40b0-984a-14eb3be5cabf","year":2018},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:551f5a6222b4015908169c8034925716aa8358782f6540b67cc09e31a8eb8dc0","observation_id":"954a9af4-07f8-4c1e-a704-7f4c4e6b5e1c","resolution":{"observed_at":"2026-05-21T06:39:04.581686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-03T21:52:33.988566Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":"2211.05102","doi":"10.48550/arxiv.2211.05102","metadata_source":"pith","pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-07-11T01:57:51.666839Z","title":"Eﬃciently Scaling Transformer Inference","venue":"cs.LG","work_id":"89acfce1-19be-43c5-b74d-cdfe66fa10d8","year":2022},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:ecbaccc75d9455a795d664b74938b3d594705cf245059991331a640e53a1e43d","observation_id":"7b535baf-9b7d-4ea7-9668-a50fe86a4abc","resolution":{"observed_at":"2026-05-21T06:39:04.533914Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07904","last_updated":"2024-08-19T17:16:55Z","snapshot_observed_at":"2026-08-01T18:05:06.274262Z","submitted_at":"2024-04-11T16:43:03Z","title":"HGRN2: Gated Linear RNNs with State Expansion","version":2},"cited_work":{"arxiv_id":"2404.07904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.07904","snapshot_observed_at":"2026-07-03T17:28:44.977281Z","title":"Hgrn2: Gated linear rnns with state expansion.ArXiv preprint, abs/2404.07904","venue":null,"work_id":"62f21939-fe4f-4159-bb1e-6a303fdc7b42","year":2024},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2404.07904","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:61daff48b8d3f678b2b7ff0ddba8753c293186c5be9892f93c18a8611be07122","observation_id":"256821c7-39ac-4d26-bc67-d7e1a707ad25","resolution":{"observed_at":"2026-05-21T06:39:04.421192Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":"65451e56-3eed-47fb-b51d-d1c7ddc969dc","year":2024},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:86bfbabcabdeb0371f7921f898854dfdc846fca6ae6864e6328dd269cbd37071","observation_id":"985b17a0-6dc8-433c-8422-a6ee4265ef80","resolution":{"observed_at":"2026-05-21T06:39:04.547434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Linear Transformers Are Secretly Fast Weight Program- mers","venue":null,"work_id":"a44d3263-4408-4dd3-8381-821205c615ec","year":2021},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:d004ffec95ddb4b50680fecdb356ac734c71fa8403b2c78950032ae908b434ce","observation_id":"cbdf8d20-0202-4fb2-9969-0de1e97c3901","resolution":{"observed_at":"2026-05-21T06:39:04.549568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to control fast-weight memories: An alternative to dynamic recurrent networks","venue":null,"work_id":"1dc78467-738c-4fbe-84f7-f5acee8d0ef7","year":1992},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:0753cfbf20696dda20fb39fa29ea493707d73207f348b4b6706c94a7a6daadd7","observation_id":"965195e4-aa19-4a49-a588-7aa1c497e067","resolution":{"observed_at":"2026-05-21T06:39:04.555008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03057","last_updated":"2022-10-06T17:03:34Z","snapshot_observed_at":"2026-07-06T14:00:37.875054Z","submitted_at":"2022-10-06T17:03:34Z","title":"Language Models are Multilingual Chain-of-Thought Reasoners","version":1},"cited_work":{"arxiv_id":"2210.03057","doi":"10.48550/arxiv.2210.03057","metadata_source":"pith","pith_arxiv_id":"2210.03057","snapshot_observed_at":"2026-07-11T01:37:42.691693Z","title":"Language Models are Multilingual Chain-of-Thought Reasoners","venue":"cs.CL","work_id":"1534249c-ff7a-417c-9fb7-7505743d1c20","year":2022},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2210.03057","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:25a4271abe1905bc664a8a9bf882c5b69c16b9a0a02eee8785296ec4c732c48b","observation_id":"d4acf531-a27d-42ec-ad96-1dce1c3b7701","resolution":{"observed_at":"2026-05-21T06:39:04.424716Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1505.00387","last_updated":"2015-11-03T18:15:15Z","snapshot_observed_at":"2026-07-06T04:16:46.012738Z","submitted_at":"2015-05-03T01:56:57Z","title":"Highway Networks","version":2},"cited_work":{"arxiv_id":"1505.00387","doi":"10.48550/arxiv.1505.00387","metadata_source":"pith","pith_arxiv_id":"1505.00387","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Highway Networks","venue":"cs.LG","work_id":"2ba1e9bc-bbb7-470f-aba1-b4bf4d7a88c5","year":2015},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/1505.00387","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:c8aa7843bc4d2205be6b8c464f5ce8e7da93874a5a3182e92d800ab32b24187b","observation_id":"7bbed93b-10a4-40fd-9dbc-821b02f4f526","resolution":{"observed_at":"2026-05-21T06:39:04.427995Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:23.483436+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:23.483436+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04620","last_updated":"2025-08-31T18:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-05T16:23:20Z","title":"Learning to (Learn at Test Time): RNNs with Expressive Hidden States","version":4},"cited_work":{"arxiv_id":"2407.04620","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.04620","snapshot_observed_at":"2026-07-09T18:46:26.563289Z","title":"Learning to (Learn at Test Time): RNNs with Expressive Hidden States","venue":"cs.LG","work_id":"c682430c-e7a2-4699-b82d-55287448dbba","year":2024},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2407.04620","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:c72a602f3c60dfce70d5723b0d6cb5c65a0a48f86bccd98299fdc68200045b15","observation_id":"f7ab781d-54a3-4900-a862-35281fbb51e5","resolution":{"observed_at":"2026-05-21T06:39:04.431481Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":"2307.08621","doi":"10.48550/arxiv.2307.08621","metadata_source":"pith","pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","venue":"cs.CL","work_id":"5b0449ac-92b0-41f2-8b4f-586c2b5a08b6","year":2023},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:1e2b13b3d4892de50f4acfe29c75f5798a7eb871d95461c44b8e8edb04b52c97","observation_id":"c5abe985-4c09-4ff3-b680-94c37adb10e5","resolution":{"observed_at":"2026-05-21T06:39:04.434610Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":"2210.09261","doi":"10.48550/arxiv.2210.09261","metadata_source":"pith","pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","venue":"cs.CL","work_id":"513eb205-04ca-4722-9a43-a74e8cbe7e85","year":2022},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:d23deb1bbfb458657a670d297c27831e423c6b4f558aa5d5e25ee571a1466e68","observation_id":"99edfd30-3825-4bce-8a83-397cf9a4e9ee","resolution":{"observed_at":"2026-05-21T06:39:04.437729Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling Stick-Breaking Attention: An Efficient Implementation and In-depth Study","venue":null,"work_id":"3088b7de-7c1a-40c1-9331-e360663413db","year":2025},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:11b0353f0bab83194d122276e70d2a893d99af3125dd46288d29d89e438e9993","observation_id":"0d64c5d0-1fda-419c-b031-6519a39c4969","resolution":{"observed_at":"2026-05-21T06:39:04.570531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.17239","last_updated":"2021-04-07T08:08:39Z","snapshot_observed_at":"2026-08-02T11:40:02.915595Z","submitted_at":"2021-03-31T17:37:32Z","title":"Going deeper with Image Transformers","version":2},"cited_work":{"arxiv_id":"2103.17239","doi":"10.48550/arxiv.2103.17239","metadata_source":"arxiv_reference","pith_arxiv_id":"2103.17239","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Wang, H., Ma, S., Dong, L., Huang, S., Zhang, D., and Wei, F","venue":null,"work_id":"bcd7d78c-82ee-493c-96cf-403fe6765b9d","year":2021},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2103.17239","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:6ce22b8cf9b6c8502261e2c367811513dd1aee1238edcaac306f016e85b0fbbe","observation_id":"552265fb-b7c5-4cda-a845-c9aeb7553a73","resolution":{"observed_at":"2026-05-21T06:39:04.441462Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-07-11T03:47:48.508181Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:69c2e1460896e9dd9ebf5e9267d6cf441ebed6583bd86ca1621852311ac046e9","observation_id":"7680f6e7-6203-4138-9538-323702922807","resolution":{"observed_at":"2026-05-21T06:39:04.444807Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention is All you Need","venue":null,"work_id":"4f7baad5-7326-427c-9891-2c10d58b979a","year":2017},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:43a8bccb879a5ae665fffc032255c3c994c9e83b316b145ebbb109d36e13c995","observation_id":"37dbbe2f-d96c-4a50-ab6a-199126564810","resolution":{"observed_at":"2026-05-21T06:39:04.579633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention is All you Need","venue":null,"work_id":"b79ab31c-86bc-41f6-a155-ea0f6c527cb0","year":2017},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:10151d2d181629be0bdf60a42f0d7317d00723a82ad9029faab659f1c3de116e","observation_id":"8185eb06-ab67-4478-afba-ba59251bccb5","resolution":{"observed_at":"2026-05-21T06:39:04.540798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00555","last_updated":"2022-03-01T15:36:38Z","snapshot_observed_at":"2026-07-06T12:42:54.843395Z","submitted_at":"2022-03-01T15:36:38Z","title":"DeepNet: Scaling Transformers to 1,000 Layers","version":1},"cited_work":{"arxiv_id":"2203.00555","doi":"10.48550/arxiv.2203.00555","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.00555","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Xiong, R., Yang, Y ., He, D., Zheng, K., Zheng, S., Xing, C., Zhang, H., Lan, Y ., Wang, L., and Liu, T.-Y","venue":null,"work_id":"80d58e2d-841f-4d87-a1b6-a2b5c105498a","year":2022},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2203.00555","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:ef7110e11195f731d6306e8d4c2c603bccb17d2ec2ed4fa2f628905b02c2a860","observation_id":"9f5b1146-dfed-49fb-8341-7c72123b16ed","resolution":{"observed_at":"2026-05-21T06:39:04.447997Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T20:54:08.912805+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T20:54:08.912805+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":"275bf3b1-1af7-4396-847d-ef7473e2cd96","year":2024},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:675fb52ec5b0b01ababdc64c51b142764cac4a4291c4aa0c1f25753830f12ee6","observation_id":"618d7ae0-5c22-4467-8fe5-075080504a83","resolution":{"observed_at":"2026-05-21T06:39:04.557297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MUDDFormer: Breaking Residual Bottlenecks in Transformers via Multiway Dynamic Dense Connections","venue":null,"work_id":"c2262f9b-c8a3-4dc0-b586-ed24cbf0755d","year":2025},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:6ca3627485ac4411677620642c62744dc7ca812d0e137ae73cc04622b1fa40db","observation_id":"b49422f5-ddb2-4966-b838-b5af57ad2b6b","resolution":{"observed_at":"2026-05-21T06:39:04.559488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":"2309.17453","doi":"10.48550/arxiv.2309.17453","metadata_source":"pith","pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Efficient Streaming Language Models with Attention Sinks","venue":"cs.CL","work_id":"a8d25452-c237-48c9-88a4-682717c3979a","year":2023},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:8c456b7a6f7dab59a4a98e5362616f3f4cac5646cad3ea6a780d1dbbb2afc122","observation_id":"9c1bd94b-8509-49bc-b6f8-44b4d8c07bcc","resolution":{"observed_at":"2026-05-21T06:39:04.450919Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"p/2010852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zhihu blog post","venue":null,"work_id":"1f203fd5-ae05-4555-9c41-bdd0c50b3770","year":2026},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:ef69946b69afe2db64ec926773cbd949641ba783df90ce1abba5800470ac0943","observation_id":"72c99b56-9c08-4595-98e6-2f71d6e3ddca","resolution":{"observed_at":"2026-05-21T06:39:04.454904Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.24880","last_updated":"2026-01-05T16:51:18Z","snapshot_observed_at":"2026-08-03T01:54:33.526522Z","submitted_at":"2025-12-31T14:16:26Z","title":"mHC: Manifold-Constrained Hyper-Connections","version":2},"cited_work":{"arxiv_id":"2512.24880","doi":"10.48550/arxiv.2512.24880","metadata_source":"pith","pith_arxiv_id":"2512.24880","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"mHC: Manifold-Constrained Hyper-Connections","venue":"cs.CL","work_id":"33e3e022-8d5c-426f-8a95-6e7124e202db","year":2025},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2512.24880","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:42b2395235f73f672a331f20ebed39f12cd8199b730c953aae61b0c7e7765dc2","observation_id":"2d02306a-a157-489d-985d-fd10fa1a027d","resolution":{"observed_at":"2026-05-21T06:39:04.458028Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.654247+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.654247+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.04745","last_updated":"2020-06-29T07:55:12Z","snapshot_observed_at":"2026-07-06T08:56:39.004549Z","submitted_at":"2020-02-12T00:33:03Z","title":"On Layer Normalization in the Transformer Architecture","version":2},"cited_work":{"arxiv_id":"2002.04745","doi":"10.48550/arxiv.2002.04745","metadata_source":"pith","pith_arxiv_id":"2002.04745","snapshot_observed_at":"2026-07-11T01:07:41.741295Z","title":"arXiv:2002.04745 [cs, stat] , author =","venue":"cs.LG","work_id":"b96fbd60-925a-4147-9115-3ea40bffdfd5","year":2020},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2002.04745","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:f52f8ad199339f78305d4c6f7e6a631475fdca8dd7b84a5baabecc7bbb7ae64d","observation_id":"185b8c26-8f61-4af6-81b0-a0a5f75ccce9","resolution":{"observed_at":"2026-05-21T06:39:04.461102Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:49:45.776368+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:49:45.776368+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2501.18795","doi":"10.48550/arxiv.2501.18795","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Rope to nope and back again: A new hybrid attention strategy","venue":null,"work_id":"2059fc0f-f372-4edd-9d00-1c44fecbbd26","year":2025},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:57829659a3f5a2e975740e49404f414fe56c333d14b355430794af4e3832469d","observation_id":"90ee231d-ec61-42ea-bae3-e9be4c0b5b05","resolution":{"observed_at":"2026-05-21T06:39:04.465116Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gated Delta Networks: Improving Mamba2 with Delta Rule","venue":null,"work_id":"eca75d4a-5c1b-4545-a571-911e9b914ca4","year":2025},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:3efd5905073f8b6186c402d4881794f9a2f720edaf6c7b582b56e68017f1c0d1","observation_id":"da977ab6-54e8-4a60-8dab-55a3c704952a","resolution":{"observed_at":"2026-05-21T06:39:04.543086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gated Linear Attention Transformers with Hardware-Efficient Training","venue":null,"work_id":"b1643948-63b9-4597-a2ee-1dc45f0c1d78","year":2024},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:d9f555b1d3f77d7ba5254d93fcb4a2c25c217936fef906455096d8a944c8146b","observation_id":"7b5ed45f-53bc-4f59-8d87-5a8505f9ca3f","resolution":{"observed_at":"2026-05-21T06:39:04.561665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.05732","doi":"10.48550/arxiv.2601.05732","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"doi:10.48550/arXiv.2601.05732 , abstract =","venue":null,"work_id":"6e915f92-ff60-4c38-9ff5-022ae0ba9c30","year":2026},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:864f0b3fe647e7f1443365ab5cb8a8a173a5a56ab719b68f40886f6fb3dc18e2","observation_id":"817bcc4f-fba8-49c3-8aa4-19aa0201042f","resolution":{"observed_at":"2026-05-21T06:39:04.468910Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:26.703275+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:26.703275+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","venue":null,"work_id":"c5ec60d2-8456-4f55-9ce3-60c2dbe6b153","year":2019},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:15507f4b255b26f97e0bab6d5eae82fa33a007444514fc324fb829f7d5d3d5e1","observation_id":"6aa1181f-7725-4e87-841e-2544cb93cba1","resolution":{"observed_at":"2026-05-21T06:39:04.566078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Root mean square layer normalization","venue":null,"work_id":"e34b2c62-1650-46b6-81cd-cab11293f12a","year":2019},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:fb5b9b352272d19a5bce46f60af44a3caec6e584e33a584bc987521200ebe830","observation_id":"73ffe95b-fb2e-4b31-86ca-d87450b3350d","resolution":{"observed_at":"2026-05-21T06:39:04.575153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.00417","last_updated":"2026-07-27T23:05:42Z","snapshot_observed_at":"2026-08-03T13:08:22.353654Z","submitted_at":"2026-01-01T18:11:38Z","title":"Deep Delta Learning","version":4},"cited_work":{"arxiv_id":"2601.00417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.00417","snapshot_observed_at":"2026-07-04T10:19:48.052784Z","title":"Deep Delta Learning","venue":"cs.LG","work_id":"d097448a-e407-422f-9089-874a4d0f16e5","year":2026},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2601.00417","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:fef18ce0f470660f3116798c71529a6798001fed6c093612134ff6fa888a6c14","observation_id":"32d94670-4d73-4ed5-bf3a-0eca83757904","resolution":{"observed_at":"2026-05-21T06:39:04.471884Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.09009","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T21:57:25.799700Z","title":"ANCRe: Adaptive neural connection reassignment for efficient depth scaling","venue":null,"work_id":"f33cb1da-1033-4afc-a21c-e98aeda17482","year":2026},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:2af44ad5dd703e72494d84b5ead54eb5d2e9e30ff8efeb5d78fae91eafcd9d78","observation_id":"075305c2-2607-4620-8629-cf95c7269415","resolution":{"observed_at":"2026-05-21T06:39:04.474989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:e457abc4ee7dbb2437bf774a9a6efbb5e398e88d5ff4230f11139a34f85e404f","observation_id":"7c9cf6dc-8503-4aa4-8453-83e63a5621bf","resolution":{"observed_at":"2026-05-21T06:39:04.478018Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19488","last_updated":"2025-05-26T04:15:38Z","snapshot_observed_at":"2026-07-06T21:30:18.842268Z","submitted_at":"2025-05-26T04:15:38Z","title":"Understanding Transformer from the Perspective of Associative Memory","version":1},"cited_work":{"arxiv_id":"2505.19488","doi":"10.48550/arxiv.2505.19488","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19488","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Understanding transformer from the perspective of as- sociative memory","venue":null,"work_id":"8203bff0-8a75-42c5-8c22-aa67ec7e6cf1","year":2025},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2505.19488","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:3eac7d87643d8a68748f2b5edd18ac85c53ad85c4fd66cf178c032cbaf26be9c","observation_id":"2bb513d6-b13d-4e65-b9ec-b5a473f04874","resolution":{"observed_at":"2026-05-21T06:39:04.482086Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Value Residual Learning","venue":null,"work_id":"fd80f826-4c3f-4883-a403-a001085be208","year":2025},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:45c847bef111cef18e20458b680cc26f3b1e4ef6f3bb318269364dd0c69b8361","observation_id":"728ac2f4-4b23-4422-994b-e2f95267e667","resolution":{"observed_at":"2026-05-21T06:39:04.577609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19606","last_updated":"2025-03-18T10:12:54Z","snapshot_observed_at":"2026-07-06T19:24:03.133851Z","submitted_at":"2024-09-29T07:57:07Z","title":"Hyper-Connections","version":3},"cited_work":{"arxiv_id":"2409.19606","doi":"10.48550/arxiv.2409.19606","metadata_source":"arxiv_reference","pith_arxiv_id":"2409.19606","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Hyper-Connections","venue":null,"work_id":"6cfc7245-c5ef-4350-8cb4-4857c9019ca2","year":2024},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2409.19606","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:bb106cef96c40420b0bedcae3823ae75b6799286e4361fe0d4eb665633b41541","observation_id":"ac404945-6750-43ee-8dd7-df19403f4fb4","resolution":{"observed_at":"2026-05-21T06:39:04.485046Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:26.304381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:26.304381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"36692155-3f05-43c6-b922-3db00d3dfd12","year":null},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:5e56dcb914778d93f5378a667165489a174de406c37763dbff3661c41d505c48","observation_id":"4a200686-d93c-4cbe-84b0-d98ab9b9c9ea","resolution":{"observed_at":"2026-05-21T06:39:04.563688Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.04598","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T23:29:02.646734Z","title":"HybridNorm: Towards Stable and Efficient Transformer Training via Hybrid Normalization","venue":null,"work_id":"0e755e4b-9baf-4b33-a332-2ec0a9dcdca8","year":2025},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:18084f8df84bdee240725180de8980f62b57da51d73cb22fbbb7d14aaec6f8d2","observation_id":"f45a50d7-407e-49fa-b27e-4c577da0d402","resolution":{"observed_at":"2026-05-21T06:39:04.488346Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":54,"verified_fuzzy":19},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 65 inbound Pith citation observations for arXiv:2603.15031."}