{"as_of":"2026-08-06T12:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c1bba90ff35b271f90dd48b85fff73d1cb997c203e26ad5f773dbeaf4acc2830","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":30,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T16:23:14.385860Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T07:49:39.775848Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-05T02:24:20.613110Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":"2402.01032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-04T07:49:39.775848Z","title":"Repeat after me: Transformers are bet- ter than state space models at copying","venue":null,"work_id":"20142145-2ae1-401d-b482-0a9f3c17c750","year":2024},"citing_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T06:58:17.370396Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2402.19427"},"observation_digest":"sha256:a68ae2cb5e4309fdc5fd1b969bc130962abf807afbfa7c5d383c494f286b2c0d","observation_id":"4785e0e2-ffce-4e15-87fe-1fa1c43050d1","resolution":{"observed_at":"2026-05-15T06:58:17.519265Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-05T02:24:20.613110Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":"2402.01032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-04T07:49:39.775848Z","title":"Repeat after me: Transformers are bet- ter than state space models at copying","venue":null,"work_id":"20142145-2ae1-401d-b482-0a9f3c17c750","year":2024},"citing_paper":{"arxiv_id":"2406.07887","last_updated":"2024-06-12T05:25:15Z","snapshot_observed_at":"2026-07-06T18:29:21.709395Z","submitted_at":"2024-06-12T05:25:15Z","title":"An Empirical Study of Mamba-based Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T10:31:03.777169Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2406.07887"},"observation_digest":"sha256:617e2d9605bcf5ab75af7acdd94dfab3c7145fc9d396e3510d7386b6fc26bda4","observation_id":"f6b2ad84-3d20-4dd8-bc39-137bce7e2a5b","resolution":{"observed_at":"2026-05-18T10:31:03.861393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-05T02:24:20.613110Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":"2402.01032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-04T07:49:39.775848Z","title":"Repeat after me: Transformers are bet- ter than state space models at copying","venue":null,"work_id":"20142145-2ae1-401d-b482-0a9f3c17c750","year":2024},"citing_paper":{"arxiv_id":"2509.26645","last_updated":"2026-03-03T12:58:09Z","snapshot_observed_at":"2026-07-30T21:37:36.891851Z","submitted_at":"2025-09-30T17:59:51Z","title":"TTT3R: 3D Reconstruction as Test-Time Training","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-17T06:41:16.306593Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2509.26645"},"observation_digest":"sha256:e13a8233c16439c046094786ebc74880e8352ca94a64033abd98acc6d58f4120","observation_id":"5e71ee86-8927-4fc7-b8d0-87a84a262889","resolution":{"observed_at":"2026-05-17T06:41:16.436769Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-05T02:24:20.613110Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-08-04T12:55:17.799547Z","title":"M., and Malach, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.05141","last_updated":"2026-05-26T14:52:39Z","snapshot_observed_at":"2026-08-04T12:55:13.353234Z","submitted_at":"2025-10-01T21:53:42Z","title":"To model human linguistic prediction, make LLMs less superhuman","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T12:55:17.799547Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2510.05141"},"observation_digest":"sha256:dd05eb88fe9f7c5964849a7b26a67c1db6471fa4925537ffe5b3c74fee0aedd9","observation_id":"4ec361f8-de23-415e-8b48-2abadecf5c13","resolution":{"observed_at":"2026-08-04T12:55:17.799547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-05T02:24:20.613110Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":"2402.01032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-04T07:49:39.775848Z","title":"Repeat after me: Transformers are bet- ter than state space models at copying","venue":null,"work_id":"20142145-2ae1-401d-b482-0a9f3c17c750","year":2024},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:58186892a57fb2c6c9bb390c770a750792674322cb399c81e97fec0d76368880","observation_id":"f3f7ac2c-eccf-44b4-984b-62f8888dbd4a","resolution":{"observed_at":"2026-05-13T23:49:11.163140Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-05T02:24:20.613110Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-08-03T23:33:56.548151Z","title":"Repeat after me: Transformers are better than state space models at copying","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-05T19:12:56.677346Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:56.548151Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:7cc31580050948910d93d7a31ace3f11576235c3bd3b72f815d999df5d58cab2","observation_id":"8103b078-7df7-4329-8404-fb9a9755987a","resolution":{"observed_at":"2026-08-03T23:33:56.548151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-05T02:24:20.613110Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":"2402.01032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-04T07:49:39.775848Z","title":"Repeat after me: Transformers are bet- ter than state space models at copying","venue":null,"work_id":"20142145-2ae1-401d-b482-0a9f3c17c750","year":2024},"citing_paper":{"arxiv_id":"2511.21016","last_updated":"2026-05-17T20:43:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-26T03:26:37Z","title":"Gated KalmaNet: A Fading Memory Layer Through Test-Time Ridge Regression","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T17:59:23.826110Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2511.21016"},"observation_digest":"sha256:7198a29f9e786127d53af61433d61950b59b9a25b9e7ec81871b619ab5d62eaf","observation_id":"7cd71372-04b3-411a-86a3-38862c2577d6","resolution":{"observed_at":"2026-05-21T18:00:27.090936Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-05T02:24:20.613110Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-08-03T15:22:50.161253Z","title":"Repeat after me: Transformers are better than state space models at copying.arXiv preprint arXiv:2402.01032, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.17351","last_updated":"2026-07-28T16:53:50Z","snapshot_observed_at":"2026-08-03T18:14:53.588030Z","submitted_at":"2025-12-19T08:47:28Z","title":"Physics of Language Models: Part 4.1, Architecture Design and the Magic of Canon Layers","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T15:22:50.161253Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2512.17351"},"observation_digest":"sha256:5c00c7c6a2120c2c078ca50ff88d8f1a16baf28b7b9c07731bc3216bdfd945d7","observation_id":"31bba847-f7ed-4acd-9271-7a3a672b259d","resolution":{"observed_at":"2026-08-03T15:22:50.161253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-05T02:24:20.613110Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":"2402.01032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-04T07:49:39.775848Z","title":"Repeat after me: Transformers are bet- ter than state space models at copying","venue":null,"work_id":"20142145-2ae1-401d-b482-0a9f3c17c750","year":2024},"citing_paper":{"arxiv_id":"2512.22471","last_updated":"2026-05-16T15:25:03Z","snapshot_observed_at":"2026-08-02T17:27:06.525378Z","submitted_at":"2025-12-27T05:28:58Z","title":"The Bayesian Geometry of Transformer Attention","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T16:15:57.408685Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2512.22471"},"observation_digest":"sha256:5857593505ba9f19c96819e9474c0966e5055e9cad35bbd8857e059bbc53724f","observation_id":"31684462-8ffd-4905-adcd-93b9b894d592","resolution":{"observed_at":"2026-05-21T16:20:20.659781Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-05T02:24:20.613110Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-08-03T03:51:43.479561Z","title":"M., and Malach, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.06774","last_updated":"2026-06-16T19:54:13Z","snapshot_observed_at":"2026-08-05T02:06:44.105573Z","submitted_at":"2026-02-06T15:29:46Z","title":"Towards Understanding What State Space Models Learn About Code","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-03T03:51:43.479561Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2602.06774"},"observation_digest":"sha256:87f18dd8c49d7d1b00915d09298280ff419e26ae522bb88f8f98ffc7e639afaa","observation_id":"52bab556-5e0a-451b-974f-9fde3c04def9","resolution":{"observed_at":"2026-08-03T03:51:43.479561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-05T02:24:20.613110Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":"2402.01032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-04T07:49:39.775848Z","title":"Repeat after me: Transformers are bet- ter than state space models at copying","venue":null,"work_id":"20142145-2ae1-401d-b482-0a9f3c17c750","year":2024},"citing_paper":{"arxiv_id":"2604.05923","last_updated":"2026-04-07T14:23:40Z","snapshot_observed_at":"2026-08-04T01:48:44.289003Z","submitted_at":"2026-04-07T14:23:40Z","title":"The UNDO Flip-Flop: A Controlled Probe for Reversible Semantic State Management in State Space Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T18:45:35.405345Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2604.05923"},"observation_digest":"sha256:5809d1cca77dff0b817c525e1bbd8b91475c87424fa03bc75adc4243d5a9c91d","observation_id":"effe2026-80e9-4099-9641-bacc9a687709","resolution":{"observed_at":"2026-05-11T00:00:52.709421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-05T02:24:20.613110Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":"2402.01032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-04T07:49:39.775848Z","title":"Repeat after me: Transformers are bet- ter than state space models at copying","venue":null,"work_id":"20142145-2ae1-401d-b482-0a9f3c17c750","year":2024},"citing_paper":{"arxiv_id":"2604.21215","last_updated":"2026-04-23T02:12:58Z","snapshot_observed_at":"2026-07-06T23:07:51.979267Z","submitted_at":"2026-04-23T02:12:58Z","title":"The Recurrent Transformer: Greater Effective Depth and Efficient Decoding","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-09T22:03:35.260373Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2604.21215"},"observation_digest":"sha256:5e8ccd14ab98071520430d3a6f964b50eb944ac87fce377861c178ee672b409b","observation_id":"5215fe50-c4af-46e9-bf7e-663a5d4856ef","resolution":{"observed_at":"2026-05-11T14:21:04.627239Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-05T02:24:20.613110Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":"2402.01032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-04T07:49:39.775848Z","title":"Repeat after me: Transformers are bet- ter than state space models at copying","venue":null,"work_id":"20142145-2ae1-401d-b482-0a9f3c17c750","year":2024},"citing_paper":{"arxiv_id":"2605.06683","last_updated":"2026-04-24T20:37:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-24T20:37:21Z","title":"Toeplitz MLP Mixers are Low Complexity, Information-Rich Sequence Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-11T01:07:33.756985Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2605.06683"},"observation_digest":"sha256:c8b726d03b6467f9e903668ee258224af1c0a8a55b8ab96a2ecee47d043708a8","observation_id":"a966edb1-f8a6-4fb8-b3dd-aac28ccb0c79","resolution":{"observed_at":"2026-05-11T04:45:56.203904Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-05T02:24:20.613110Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":"2402.01032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-04T07:49:39.775848Z","title":"Repeat after me: Transformers are bet- ter than state space models at copying","venue":null,"work_id":"20142145-2ae1-401d-b482-0a9f3c17c750","year":2024},"citing_paper":{"arxiv_id":"2605.06997","last_updated":"2026-05-07T22:26:27Z","snapshot_observed_at":"2026-08-02T23:31:22.583542Z","submitted_at":"2026-05-07T22:26:27Z","title":"Echo: KV-Cache-Free Associative Recall with Spectral Koopman Operators","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-11T01:26:48.026538Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2605.06997"},"observation_digest":"sha256:26d95a1741df5b99c2f0dfb97353fdc1ff7edf9824c4917d3733b8ada03cf052","observation_id":"ad50ff5c-3d7c-4fe5-bd79-3d8a57f0aca5","resolution":{"observed_at":"2026-05-11T04:25:56.325867Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-05T02:24:20.613110Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":"2402.01032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-04T07:49:39.775848Z","title":"Repeat after me: Transformers are bet- ter than state space models at copying","venue":null,"work_id":"20142145-2ae1-401d-b482-0a9f3c17c750","year":2024},"citing_paper":{"arxiv_id":"2605.09472","last_updated":"2026-05-10T10:58:20Z","snapshot_observed_at":"2026-07-06T23:21:35.327066Z","submitted_at":"2026-05-10T10:58:20Z","title":"Positional LSH: Binary Block Matrix Approximation for Attention with Linear Biases","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-12T04:29:37.989500Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2605.09472"},"observation_digest":"sha256:c51e5444feb03b356a729c23071dd97209d3a3e979ac08cf441064909fc1d122","observation_id":"bc1e3a80-bddc-4fb0-b861-9bad26bb08db","resolution":{"observed_at":"2026-05-12T06:11:27.007244Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-05T02:24:20.613110Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":"2402.01032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-04T07:49:39.775848Z","title":"Repeat after me: Transformers are bet- ter than state space models at copying","venue":null,"work_id":"20142145-2ae1-401d-b482-0a9f3c17c750","year":2024},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:07a0e83092da03ed482016f19e1f47c5c02b2f74ac10041f65cf1711fef8e383","observation_id":"e827a593-b678-41e4-b8a5-15afeea5ad62","resolution":{"observed_at":"2026-05-14T19:09:23.228532Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-05T02:24:20.613110Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":"2402.01032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-04T07:49:39.775848Z","title":"Repeat after me: Transformers are bet- ter than state space models at copying","venue":null,"work_id":"20142145-2ae1-401d-b482-0a9f3c17c750","year":2024},"citing_paper":{"arxiv_id":"2605.26099","last_updated":"2026-06-05T05:36:49Z","snapshot_observed_at":"2026-07-06T23:36:01.564747Z","submitted_at":"2026-05-25T17:55:39Z","title":"Do Language Models Need Sleep? Offline Recurrence for Improved Online Inference","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T21:37:51.638904Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2605.26099"},"observation_digest":"sha256:14a985c0c44192045f4a3b9e5b2925a812d8907b2473ed9286c2e60e31376030","observation_id":"7606210a-7535-4e13-a8d3-435571d897c7","resolution":{"observed_at":"2026-06-29T21:43:59.528847Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-05T02:24:20.613110Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":"2402.01032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-04T07:49:39.775848Z","title":"Repeat after me: Transformers are bet- ter than state space models at copying","venue":null,"work_id":"20142145-2ae1-401d-b482-0a9f3c17c750","year":2024},"citing_paper":{"arxiv_id":"2606.00390","last_updated":"2026-05-29T22:12:40Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:12:40Z","title":"Zamba2-VL Technical Report","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-28T22:34:20.970856Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2606.00390"},"observation_digest":"sha256:6f22181e0f53c1052543299b7e0e9c267a4991961fe36a3fbc27e0bd14afce57","observation_id":"f65382ec-1ece-4ce6-9e6f-5f4802358b7d","resolution":{"observed_at":"2026-07-01T19:26:00.673759Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-05T02:24:20.613110Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":"2402.01032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-04T07:49:39.775848Z","title":"Repeat after me: Transformers are bet- ter than state space models at copying","venue":null,"work_id":"20142145-2ae1-401d-b482-0a9f3c17c750","year":2024},"citing_paper":{"arxiv_id":"2606.11052","last_updated":"2026-06-09T16:17:19Z","snapshot_observed_at":"2026-08-05T14:17:36.486236Z","submitted_at":"2026-06-09T16:17:19Z","title":"Attention Amnesia in Hybrid LLMs: When CoT Fine-Tuning Breaks Long-Range Recall, and How to Fix It","version":1},"reference_index":112,"source":"arxiv_source","source_observed_at":"2026-06-27T13:08:57.218711Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2606.11052"},"observation_digest":"sha256:e1eaca7a90906054eb749b7a60e3abfa558d5ec30d93982a62eb49c78558e99e","observation_id":"3c7b0e8c-ea93-4311-8fa3-f457973d9ff0","resolution":{"observed_at":"2026-07-03T05:37:40.365982Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-05T02:24:20.613110Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":"2402.01032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-04T07:49:39.775848Z","title":"Repeat after me: Transformers are bet- ter than state space models at copying","venue":null,"work_id":"20142145-2ae1-401d-b482-0a9f3c17c750","year":2024},"citing_paper":{"arxiv_id":"2606.21884","last_updated":"2026-06-20T04:52:14Z","snapshot_observed_at":"2026-08-03T01:34:19.883808Z","submitted_at":"2026-06-20T04:52:14Z","title":"A Verifiable Search Is Not a Learnable Chain-of-Thought","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T12:35:20.698118Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2606.21884"},"observation_digest":"sha256:8251eb53f8ddd8e9c24908d587784fa21ba239e5a1c497a1217042093b8610a5","observation_id":"dff055e0-ab10-4f46-938d-37dd97af1876","resolution":{"observed_at":"2026-07-04T07:49:39.777090Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-05T02:24:20.613110Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":"2402.01032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-04T07:49:39.775848Z","title":"Repeat after me: Transformers are bet- ter than state space models at copying","venue":null,"work_id":"20142145-2ae1-401d-b482-0a9f3c17c750","year":2024},"citing_paper":{"arxiv_id":"2607.02303","last_updated":"2026-07-02T15:19:49Z","snapshot_observed_at":"2026-07-07T00:07:47.719699Z","submitted_at":"2026-07-02T15:19:49Z","title":"A Hippocampus for Linear Attention: An Exact Memory for What the Recurrent State Forgets","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-03T13:46:18.862925Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2607.02303"},"observation_digest":"sha256:cb08b890ed9c2e2b9a4e9922e6b3229188d4f92e5ec6aeecd7b72f3fb7e4cb11","observation_id":"ed936055-c6b7-4404-84e4-ce80ef412ce5","resolution":{"observed_at":"2026-07-03T13:48:20.316429Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-05T02:24:20.613110Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-14T14:50:03.831572Z","title":"[Khandelwal et al.(2020)] U","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09889","last_updated":"2026-07-10T18:28:21Z","snapshot_observed_at":"2026-08-02T12:00:29.141267Z","submitted_at":"2026-07-10T18:28:21Z","title":"Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T14:50:03.831572Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2607.09889"},"observation_digest":"sha256:673f0a636d0840c68690490db0fe4595b31b7b47ccc36813c98282959aa51a57","observation_id":"c975545d-840b-4086-ad3b-027c90be10fd","resolution":{"observed_at":"2026-07-14T14:50:03.831572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-05T02:24:20.613110Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-14T13:15:38.524121Z","title":"Kakade, and Eran Malach","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10244","last_updated":"2026-07-11T10:19:21Z","snapshot_observed_at":"2026-08-03T20:17:16.813949Z","submitted_at":"2026-07-11T10:19:21Z","title":"DSSMs: State Space Models with Explicit Memory via Delay Differential Equations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T13:15:38.524121Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2607.10244"},"observation_digest":"sha256:802a4ccf8c790e255648a1a7144b2fcc3b452412bf1f4989f1cf3615e93a2dbb","observation_id":"0aea3c71-0acc-4a0a-831f-6f5ac09bd726","resolution":{"observed_at":"2026-07-14T13:15:38.524121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-05T02:24:20.613110Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-07-14T11:45:09.424370Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10441","last_updated":"2026-07-11T18:58:22Z","snapshot_observed_at":"2026-08-06T12:42:39.212256Z","submitted_at":"2026-07-11T18:58:22Z","title":"Context by Distinct Information: An Auditable Dirichlet-Process Working Memory for Long, Redundant Context Streams","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T11:45:09.424370Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2607.10441"},"observation_digest":"sha256:5d80493998a921eecd9a993561e0e78a105a0682c2356b5c33cdd17868db3934","observation_id":"1ce7cf71-0aa1-429a-acce-aae0ba99215a","resolution":{"observed_at":"2026-07-14T11:45:09.424370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-05T02:24:20.613110Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-08-02T06:39:22.140957Z","title":"Kakade, and Eran Malach","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14144","last_updated":"2026-07-31T05:37:48Z","snapshot_observed_at":"2026-08-05T23:11:00.491442Z","submitted_at":"2026-07-14T05:52:12Z","title":"The Capability Convergence Hypothesis: Capability from Access Structure, Not Scale","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T06:39:22.140957Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2607.14144"},"observation_digest":"sha256:ed752d8f0a8fbc9ab0d846e4c4beff474ed150b7313ecf340394d5952c031175","observation_id":"e90e7497-c8d5-4d09-bdfa-ee34ab6c017d","resolution":{"observed_at":"2026-08-02T06:39:22.140957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-05T02:24:20.613110Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-08-03T02:03:24.068474Z","title":"Kakade, and Eran Malach","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14144","last_updated":"2026-07-31T05:37:48Z","snapshot_observed_at":"2026-08-05T23:11:00.491442Z","submitted_at":"2026-07-14T05:52:12Z","title":"The Capability Convergence Hypothesis: Capability from Access Structure, Not Scale","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T02:03:24.068474Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2607.14144"},"observation_digest":"sha256:567dc1255c521ac044e5c15fe84a83c1557fa44917b6b98243ba6c3df82d6a64","observation_id":"a3aa00d8-fc6d-4ebf-b856-35e685c3f74f","resolution":{"observed_at":"2026-08-03T02:03:24.068474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-05T02:24:20.613110Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-08-01T18:06:48.827702Z","title":"arXiv preprint arXiv:2402.01032 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17419","last_updated":"2026-07-19T21:46:09Z","snapshot_observed_at":"2026-08-05T15:40:44.010247Z","submitted_at":"2026-07-19T21:46:09Z","title":"Kernelized Linear Attention: Breaking the Capacity Wall with Symmetric Cones","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T18:06:48.827702Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2607.17419"},"observation_digest":"sha256:d1b9626eb3d1f0db3ca0d5117aaa81d725e54f66fe91ffab8d813fda0b2ba65a","observation_id":"86d98c18-52eb-4932-92da-eaadab7a7c71","resolution":{"observed_at":"2026-08-01T18:06:48.827702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-05T02:24:20.613110Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-08-01T17:31:47.771481Z","title":"Repeat after me: Trans- formers are better than state space models at copying.arXiv:2402.01032,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17624","last_updated":"2026-07-20T07:26:17Z","snapshot_observed_at":"2026-08-05T12:21:27.591563Z","submitted_at":"2026-07-20T07:26:17Z","title":"Can Transformers Really Do It All? On the Compatibility of Inductive Biases Across Tasks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T17:31:47.771481Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2607.17624"},"observation_digest":"sha256:f62aa1dc84f5d6b841cf60d3d4f26946c2931442fa7d5e59e9b0f9578d7d7f94","observation_id":"d26c5665-9749-4773-b242-650aa8297dc6","resolution":{"observed_at":"2026-08-01T17:31:47.771481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-05T02:24:20.613110Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-08-01T02:44:01.258380Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25357","last_updated":"2026-07-28T07:04:32Z","snapshot_observed_at":"2026-08-01T20:09:34.932018Z","submitted_at":"2026-07-28T07:04:32Z","title":"Raven: High-Recall Sequence Modeling with Sparse Memory Routing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:01.258380Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2607.25357"},"observation_digest":"sha256:57c8ce5f610e2d69ed60cfb07e2ceecf1a23339de365e3b72697672dce49b484","observation_id":"653d6092-2031-4eaf-9b84-61e86a5c15f9","resolution":{"observed_at":"2026-08-01T02:44:01.258380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-05T02:24:20.613110Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-08-04T16:23:14.385860Z","title":"Repeat after me: Trans- formers are better than state space models at copying.arXiv preprint arXiv:2402.01032,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02032","last_updated":"2026-08-03T10:30:27Z","snapshot_observed_at":"2026-08-06T12:19:40.586656Z","submitted_at":"2026-08-03T10:30:27Z","title":"DART: Decoded Attention over Recurrent States for Efficient Long-Context Sequence Modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T16:23:14.385860Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2608.02032"},"observation_digest":"sha256:42fea60b5e54cc88f19efbf288e5be33b31e1cafa53535644dfd430f3f884c67","observation_id":"74de6bad-a1d0-4c22-af69-25568eff1569","resolution":{"observed_at":"2026-08-04T16:23:14.385860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2402.01032/citation-record","integrity":"/paper/2402.01032/integrity","json":"/paper/2402.01032/citation-record.json","paper":"/paper/2402.01032"},"outbound":[],"paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-05T02:24:20.613110Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 30 inbound Pith citation observations for arXiv:2402.01032."}