{"as_of":"2026-08-08T22:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b16c7181fc9028f201251b59ca05b57831eacd2cd97e741652c625f1c32d60d5","coverage":[{"denominator":98,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":98,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:44:22.594242Z","state":"measured"},{"denominator":124,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":124,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":26,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:30:12.623623Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T19:30:07.282576Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23735","snapshot_observed_at":"2026-08-07T10:30:12.623623Z","title":"Atlas: Learning to optimally memorize the context at test time","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05233","last_updated":"2026-06-03T16:16:54Z","snapshot_observed_at":"2026-08-07T10:20:00.883360Z","submitted_at":"2025-06-05T16:50:23Z","title":"MesaNet: Sequence Modeling by Locally Optimal Test-Time Training","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T10:30:12.623623Z"},"links":{"cited_paper":"/paper/2505.23735","citing_paper":"/paper/2506.05233"},"observation_digest":"sha256:866a1cf28e7fd9eccd560d4c7b8771d0f048c73e60ff68062ed282e4314f927e","observation_id":"f2dd94e4-9d53-4bf0-83ce-caa112890040","resolution":{"observed_at":"2026-08-07T10:30:12.623623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23735","snapshot_observed_at":"2026-08-07T06:04:25.586717Z","title":"Atlas: Learning to optimally memorize the context at test time.arXiv preprint arXiv:2505.23735, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06266","last_updated":"2025-06-13T17:58:55Z","snapshot_observed_at":"2026-08-07T05:54:59.580995Z","submitted_at":"2025-06-06T17:48:23Z","title":"Cartridges: Lightweight and general-purpose long context representations via self-study","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:25.586717Z"},"links":{"cited_paper":"/paper/2505.23735","citing_paper":"/paper/2506.06266"},"observation_digest":"sha256:17dddde0fbb4bdc5f1e2204e0b67cb4993d0719f18fd329d1efe1d9f2b039363","observation_id":"ee45897e-512b-43a3-b607-1404e6d70a17","resolution":{"observed_at":"2026-08-07T06:04:25.586717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23735","snapshot_observed_at":"2026-08-06T19:14:22.085476Z","title":"Atlas: Learning to optimally memorize the context at test time","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06203","last_updated":"2025-07-10T16:43:36Z","snapshot_observed_at":"2026-08-07T04:57:37.201438Z","submitted_at":"2025-07-08T17:29:07Z","title":"A Survey on Latent Reasoning","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T19:14:22.085476Z"},"links":{"cited_paper":"/paper/2505.23735","citing_paper":"/paper/2507.06203"},"observation_digest":"sha256:7ba31db7694420e25240ae4b007cc2a3055cc84d7b68d569c8ccbcfedab2f762","observation_id":"c89d7533-c696-400b-9181-df9087f04c47","resolution":{"observed_at":"2026-08-06T19:14:22.085476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23735","snapshot_observed_at":"2026-08-05T20:15:47.537098Z","title":"Atlas: Learning to optimally memorize the context at test time","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10824","last_updated":"2025-08-16T03:17:35Z","snapshot_observed_at":"2026-08-06T02:00:57.019893Z","submitted_at":"2025-08-14T16:48:38Z","title":"Memory-Augmented Transformers: A Systematic Review from Neuroscience Principles to Enhanced Model Architectures","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T20:15:47.537098Z"},"links":{"cited_paper":"/paper/2505.23735","citing_paper":"/paper/2508.10824"},"observation_digest":"sha256:40d6a892d543d7110650aa1de069bdae47a737f4c7f7d0136fe2c6e2722f3a2f","observation_id":"d58973ec-a760-467b-868e-1c3284144ef1","resolution":{"observed_at":"2026-08-05T20:15:47.537098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"cited_work":{"arxiv_id":"2505.23735","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23735","snapshot_observed_at":"2026-07-04T19:30:07.282576Z","title":"Atlas: Learning to optimally memorize the context at test time.arXiv preprint arXiv:2505.23735, 2025a","venue":null,"work_id":"88ad83a5-1a41-49a6-a975-2d9374634987","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-08-07T19:30:34.681869Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2505.23735","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:33f9e8cf1204bfd38123efcb39aee62d5836f05fa3d46d85f933ed23840cfa7f","observation_id":"0a88c6d3-38f2-435a-81e3-042c953e7f23","resolution":{"observed_at":"2026-05-13T23:49:10.676753Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"cited_work":{"arxiv_id":"2505.23735","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23735","snapshot_observed_at":"2026-07-04T19:30:07.282576Z","title":"Atlas: Learning to optimally memorize the context at test time.arXiv preprint arXiv:2505.23735, 2025a","venue":null,"work_id":"88ad83a5-1a41-49a6-a975-2d9374634987","year":2025},"citing_paper":{"arxiv_id":"2510.27258","last_updated":"2026-05-14T15:35:59Z","snapshot_observed_at":"2026-08-08T14:18:17.260680Z","submitted_at":"2025-10-31T07:54:37Z","title":"Higher-order Linear Attention","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T03:05:35.823369Z"},"links":{"cited_paper":"/paper/2505.23735","citing_paper":"/paper/2510.27258"},"observation_digest":"sha256:cd511a2504b4eda01cd10fab72d7b9d4bd392d287f9cc9cbdef68bfcd6603d4c","observation_id":"d6a80bfe-9f95-4cb2-8fb6-68872621c452","resolution":{"observed_at":"2026-05-18T03:05:47.411914Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"cited_work":{"arxiv_id":"2505.23735","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23735","snapshot_observed_at":"2026-07-04T19:30:07.282576Z","title":"Atlas: Learning to optimally memorize the context at test time.arXiv preprint arXiv:2505.23735, 2025a","venue":null,"work_id":"88ad83a5-1a41-49a6-a975-2d9374634987","year":2025},"citing_paper":{"arxiv_id":"2511.07328","last_updated":"2026-05-04T15:02:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-10T17:31:02Z","title":"Q-RAG: Long Context Multi-step Retrieval via Value-based Embedder Training","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-17T23:27:49.126341Z"},"links":{"cited_paper":"/paper/2505.23735","citing_paper":"/paper/2511.07328"},"observation_digest":"sha256:154edeea59a80f4dc37c023adf2b57d1d751db3fe636c86833609bd7e4375242","observation_id":"7d74f784-2f8c-47a7-99cd-18d493e89dfc","resolution":{"observed_at":"2026-05-17T23:30:29.428699Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"cited_work":{"arxiv_id":"2505.23735","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23735","snapshot_observed_at":"2026-07-04T19:30:07.282576Z","title":"Atlas: Learning to optimally memorize the context at test time.arXiv preprint arXiv:2505.23735, 2025a","venue":null,"work_id":"88ad83a5-1a41-49a6-a975-2d9374634987","year":2025},"citing_paper":{"arxiv_id":"2512.01643","last_updated":"2026-04-20T11:19:37Z","snapshot_observed_at":"2026-07-06T22:37:26.652349Z","submitted_at":"2025-12-01T13:14:48Z","title":"ViT$^3$: Unlocking Test-Time Training in Vision","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-17T02:59:42.731098Z"},"links":{"cited_paper":"/paper/2505.23735","citing_paper":"/paper/2512.01643"},"observation_digest":"sha256:6930d5362996d85a009357abc66677cbb947b576b6a133b65e2605cdc49dfb15","observation_id":"a5fcc9cd-c013-4449-803f-49397af597da","resolution":{"observed_at":"2026-05-17T03:01:28.565265Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"cited_work":{"arxiv_id":"2505.23735","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23735","snapshot_observed_at":"2026-07-04T19:30:07.282576Z","title":"Atlas: Learning to optimally memorize the context at test time.arXiv preprint arXiv:2505.23735, 2025a","venue":null,"work_id":"88ad83a5-1a41-49a6-a975-2d9374634987","year":2025},"citing_paper":{"arxiv_id":"2602.21204","last_updated":"2026-05-12T22:37:21Z","snapshot_observed_at":"2026-08-03T04:44:07.548954Z","submitted_at":"2026-02-24T18:59:30Z","title":"Test-Time Training with KV Binding Is Secretly Linear Attention","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T19:40:35.854519Z"},"links":{"cited_paper":"/paper/2505.23735","citing_paper":"/paper/2602.21204"},"observation_digest":"sha256:7e88c1a2e9b9aa66477421ca4036892faca9685e91a86a95449262ac9470517d","observation_id":"adbfb8f6-052b-4c57-ac12-f011add2e287","resolution":{"observed_at":"2026-05-15T19:41:32.751261Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23735","snapshot_observed_at":"2026-07-15T12:09:16.468055Z","title":"Atlas: Learning to optimally memorize the context at test time.URL https://arxiv","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.09221","last_updated":"2026-05-29T05:28:18Z","snapshot_observed_at":"2026-07-15T12:09:13.856257Z","submitted_at":"2026-03-10T05:42:13Z","title":"Beyond Test-Time Memory: State-Space Optimal Control for LLM Reasoning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-15T12:09:16.468055Z"},"links":{"cited_paper":"/paper/2505.23735","citing_paper":"/paper/2603.09221"},"observation_digest":"sha256:e43de113217f55b3e8546d73026551323bee0d94d05d4afc842829a3a62dd514","observation_id":"1c34e7f2-9bc9-4425-a69e-3ee15492f910","resolution":{"observed_at":"2026-07-15T12:09:16.468055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"cited_work":{"arxiv_id":"2505.23735","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23735","snapshot_observed_at":"2026-07-04T19:30:07.282576Z","title":"Atlas: Learning to optimally memorize the context at test time.arXiv preprint arXiv:2505.23735, 2025a","venue":null,"work_id":"88ad83a5-1a41-49a6-a975-2d9374634987","year":2025},"citing_paper":{"arxiv_id":"2604.07279","last_updated":"2026-04-08T16:41:22Z","snapshot_observed_at":"2026-07-06T22:55:33.502756Z","submitted_at":"2026-04-08T16:41:22Z","title":"Mem3R: Streaming 3D Reconstruction with Hybrid Memory via Test-Time Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T18:32:42.456629Z"},"links":{"cited_paper":"/paper/2505.23735","citing_paper":"/paper/2604.07279"},"observation_digest":"sha256:3580379a05079361528422d63e63d3e3cf1022e81ce1ccd70698cc5137e25e68","observation_id":"45713797-2934-4b8d-82ea-231ba4c3b630","resolution":{"observed_at":"2026-05-11T00:25:50.747862Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"cited_work":{"arxiv_id":"2505.23735","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23735","snapshot_observed_at":"2026-07-04T19:30:07.282576Z","title":"Atlas: Learning to optimally memorize the context at test time.arXiv preprint arXiv:2505.23735, 2025a","venue":null,"work_id":"88ad83a5-1a41-49a6-a975-2d9374634987","year":2025},"citing_paper":{"arxiv_id":"2604.07350","last_updated":"2026-04-08T17:59:48Z","snapshot_observed_at":"2026-08-04T03:38:38.092494Z","submitted_at":"2026-04-08T17:59:48Z","title":"Fast Spatial Memory with Elastic Test-Time Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T18:27:24.750995Z"},"links":{"cited_paper":"/paper/2505.23735","citing_paper":"/paper/2604.07350"},"observation_digest":"sha256:02f43c61702fcfb02e3f78b310a54c2519a03c55f619ad4cf2995736391ee0df","observation_id":"9ca0a74b-540b-4f02-a3a8-ce6baf61bc81","resolution":{"observed_at":"2026-05-11T00:35:50.000298Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"cited_work":{"arxiv_id":"2505.23735","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23735","snapshot_observed_at":"2026-07-04T19:30:07.282576Z","title":"Atlas: Learning to optimally memorize the context at test time.arXiv preprint arXiv:2505.23735, 2025a","venue":null,"work_id":"88ad83a5-1a41-49a6-a975-2d9374634987","year":2025},"citing_paper":{"arxiv_id":"2604.16484","last_updated":"2026-04-13T03:19:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-13T03:19:36Z","title":"DexWorldModel: Causal Latent World Modeling towards Automated Learning of Embodied Tasks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T16:42:34.639008Z"},"links":{"cited_paper":"/paper/2505.23735","citing_paper":"/paper/2604.16484"},"observation_digest":"sha256:8dd94d7ac3940b0f89ed34b8ea9bb183a1a778e3688d97a61d66c9c47addc728","observation_id":"5170ae57-cfc2-42ad-9ecf-98d60cbc82cf","resolution":{"observed_at":"2026-05-11T08:20:59.486932Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"cited_work":{"arxiv_id":"2505.23735","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23735","snapshot_observed_at":"2026-07-04T19:30:07.282576Z","title":"Atlas: Learning to optimally memorize the context at test time.arXiv preprint arXiv:2505.23735, 2025a","venue":null,"work_id":"88ad83a5-1a41-49a6-a975-2d9374634987","year":2025},"citing_paper":{"arxiv_id":"2604.18131","last_updated":"2026-04-20T11:54:20Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T11:54:20Z","title":"Training LLM Agents for Spontaneous, Reward-Free Self-Evolution via World Knowledge Exploration","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T04:36:27.381942Z"},"links":{"cited_paper":"/paper/2505.23735","citing_paper":"/paper/2604.18131"},"observation_digest":"sha256:f8da40adedea357d719d87607e2927234f249576b5abc8a480a6414e05a0b54f","observation_id":"939b283f-c44a-4a6f-9de8-66075a7d0af4","resolution":{"observed_at":"2026-05-10T12:10:23.480004Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"cited_work":{"arxiv_id":"2505.23735","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23735","snapshot_observed_at":"2026-07-04T19:30:07.282576Z","title":"Atlas: Learning to optimally memorize the context at test time.arXiv preprint arXiv:2505.23735, 2025a","venue":null,"work_id":"88ad83a5-1a41-49a6-a975-2d9374634987","year":2025},"citing_paper":{"arxiv_id":"2604.21100","last_updated":"2026-04-22T21:38:25Z","snapshot_observed_at":"2026-08-02T18:50:20.662385Z","submitted_at":"2026-04-22T21:38:25Z","title":"Preconditioned DeltaNet: Curvature-aware Sequence Modeling for Linear Recurrences","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-10T00:19:24.366922Z"},"links":{"cited_paper":"/paper/2505.23735","citing_paper":"/paper/2604.21100"},"observation_digest":"sha256:9a7d238a23655ee926f419c49d0efb23fb5798743105dbb16c48584c8c3063a6","observation_id":"80e48216-9297-4d91-99d5-4ad77f3262de","resolution":{"observed_at":"2026-05-10T00:19:46.550020Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"cited_work":{"arxiv_id":"2505.23735","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23735","snapshot_observed_at":"2026-07-04T19:30:07.282576Z","title":"Atlas: Learning to optimally memorize the context at test time.arXiv preprint arXiv:2505.23735, 2025a","venue":null,"work_id":"88ad83a5-1a41-49a6-a975-2d9374634987","year":2025},"citing_paper":{"arxiv_id":"2605.02772","last_updated":"2026-05-28T08:32:22Z","snapshot_observed_at":"2026-08-03T12:45:11.934276Z","submitted_at":"2026-05-04T16:16:26Z","title":"Linearizing Vision Transformer with Test-Time Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T18:25:48.672665Z"},"links":{"cited_paper":"/paper/2505.23735","citing_paper":"/paper/2605.02772"},"observation_digest":"sha256:243757d24dce6cc0fb4bab3df31ae37b71b93892a379d16bd2f8ef10adb5db24","observation_id":"fe4e1de6-140d-42b0-bfa5-f62fe14c6766","resolution":{"observed_at":"2026-05-09T06:25:48.704906Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"cited_work":{"arxiv_id":"2505.23735","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23735","snapshot_observed_at":"2026-07-04T19:30:07.282576Z","title":"Atlas: Learning to optimally memorize the context at test time.arXiv preprint arXiv:2505.23735, 2025a","venue":null,"work_id":"88ad83a5-1a41-49a6-a975-2d9374634987","year":2025},"citing_paper":{"arxiv_id":"2605.02772","last_updated":"2026-05-28T08:32:22Z","snapshot_observed_at":"2026-08-03T12:45:11.934276Z","submitted_at":"2026-05-04T16:16:26Z","title":"Linearizing Vision Transformer with Test-Time Training","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-01T00:25:41.438482Z"},"links":{"cited_paper":"/paper/2505.23735","citing_paper":"/paper/2605.02772"},"observation_digest":"sha256:e72b0f1e3715801655c14428b059e574572f5b3ee6336b17ab6706a6efa7d952","observation_id":"53f23a17-aaae-4e4d-adf4-d85a644a9342","resolution":{"observed_at":"2026-07-01T00:45:12.477760Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"cited_work":{"arxiv_id":"2505.23735","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23735","snapshot_observed_at":"2026-07-04T19:30:07.282576Z","title":"Atlas: Learning to optimally memorize the context at test time.arXiv preprint arXiv:2505.23735, 2025a","venue":null,"work_id":"88ad83a5-1a41-49a6-a975-2d9374634987","year":2025},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"cited_paper":"/paper/2505.23735","citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:6f44c89f6a0758bda8b3b63922480d51d63a5fd538a3c1d3552833350aa3e3be","observation_id":"375b403f-05fe-4862-b9f6-83e1e723134f","resolution":{"observed_at":"2026-05-11T16:41:11.660371Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"cited_work":{"arxiv_id":"2505.23735","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23735","snapshot_observed_at":"2026-07-04T19:30:07.282576Z","title":"Atlas: Learning to optimally memorize the context at test time.arXiv preprint arXiv:2505.23735, 2025a","venue":null,"work_id":"88ad83a5-1a41-49a6-a975-2d9374634987","year":2025},"citing_paper":{"arxiv_id":"2605.13473","last_updated":"2026-05-13T12:59:26Z","snapshot_observed_at":"2026-08-02T14:44:34.058937Z","submitted_at":"2026-05-13T12:59:26Z","title":"OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-14T19:08:18.768344Z"},"links":{"cited_paper":"/paper/2505.23735","citing_paper":"/paper/2605.13473"},"observation_digest":"sha256:d7c8bd586362c5196198dfcdeef4b441a6c86290c8d2f8bb8c181046cb9e6ac1","observation_id":"5fd9483a-c6aa-4b2c-8e1e-7c934fb8e84f","resolution":{"observed_at":"2026-05-14T19:09:23.240619Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"cited_work":{"arxiv_id":"2505.23735","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23735","snapshot_observed_at":"2026-07-04T19:30:07.282576Z","title":"Atlas: Learning to optimally memorize the context at test time.arXiv preprint arXiv:2505.23735, 2025a","venue":null,"work_id":"88ad83a5-1a41-49a6-a975-2d9374634987","year":2025},"citing_paper":{"arxiv_id":"2605.31163","last_updated":"2026-05-29T11:13:00Z","snapshot_observed_at":"2026-08-01T14:41:04.597557Z","submitted_at":"2026-05-29T11:13:00Z","title":"Memory by Design: Probabilistic Sequence Layers","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-28T21:07:31.407554Z"},"links":{"cited_paper":"/paper/2505.23735","citing_paper":"/paper/2605.31163"},"observation_digest":"sha256:42e6fba0f2fe9026dcea42b817c214199da0b27424e9383229b561a692793a44","observation_id":"89184193-11d1-49e8-b5f6-246a204ef326","resolution":{"observed_at":"2026-07-01T20:26:12.812167Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"cited_work":{"arxiv_id":"2505.23735","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23735","snapshot_observed_at":"2026-07-04T19:30:07.282576Z","title":"Atlas: Learning to optimally memorize the context at test time.arXiv preprint arXiv:2505.23735, 2025a","venue":null,"work_id":"88ad83a5-1a41-49a6-a975-2d9374634987","year":2025},"citing_paper":{"arxiv_id":"2606.02775","last_updated":"2026-06-01T18:38:21Z","snapshot_observed_at":"2026-08-07T06:38:00.863324Z","submitted_at":"2026-06-01T18:38:21Z","title":"AURA: Action-Gated Memory for Robot Policies at Constant VRAM","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T14:30:49.006075Z"},"links":{"cited_paper":"/paper/2505.23735","citing_paper":"/paper/2606.02775"},"observation_digest":"sha256:47cb344bc92a52830eb514f90fcded9b8f048254532022002d779c480a7f2d3b","observation_id":"904ba499-d49e-4ed0-ab7c-99a2e777c153","resolution":{"observed_at":"2026-07-01T23:16:24.348200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"cited_work":{"arxiv_id":"2505.23735","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23735","snapshot_observed_at":"2026-07-04T19:30:07.282576Z","title":"Atlas: Learning to optimally memorize the context at test time.arXiv preprint arXiv:2505.23735, 2025a","venue":null,"work_id":"88ad83a5-1a41-49a6-a975-2d9374634987","year":2025},"citing_paper":{"arxiv_id":"2606.23670","last_updated":"2026-06-22T17:56:25Z","snapshot_observed_at":"2026-08-08T15:39:37.831663Z","submitted_at":"2026-06-22T17:56:25Z","title":"Tapered Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T09:11:20.341634Z"},"links":{"cited_paper":"/paper/2505.23735","citing_paper":"/paper/2606.23670"},"observation_digest":"sha256:785b4a12d98c5264859b908cc705b25990fdaefa7248384913bd331b6ea8a4f2","observation_id":"439563a3-65ad-4d31-9745-b4944eddb58a","resolution":{"observed_at":"2026-07-04T10:09:44.024836Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"cited_work":{"arxiv_id":"2505.23735","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23735","snapshot_observed_at":"2026-07-04T19:30:07.282576Z","title":"Atlas: Learning to optimally memorize the context at test time.arXiv preprint arXiv:2505.23735, 2025a","venue":null,"work_id":"88ad83a5-1a41-49a6-a975-2d9374634987","year":2025},"citing_paper":{"arxiv_id":"2606.25342","last_updated":"2026-06-24T03:14:20Z","snapshot_observed_at":"2026-07-06T23:59:47.542695Z","submitted_at":"2026-06-24T03:14:20Z","title":"Lifelong In-Context Learning with Transformers Requires Parametric Forms of Attention","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-25T21:19:30.138022Z"},"links":{"cited_paper":"/paper/2505.23735","citing_paper":"/paper/2606.25342"},"observation_digest":"sha256:214c6478c41b609ae078046ab7248a7be7cdb683a6c655c3098d1b7d8ca0e3a8","observation_id":"09523bad-258d-4fa7-b08a-d0e83fe52654","resolution":{"observed_at":"2026-07-04T19:30:07.284085Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"cited_work":{"arxiv_id":"2505.23735","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23735","snapshot_observed_at":"2026-07-04T19:30:07.282576Z","title":"Atlas: Learning to optimally memorize the context at test time.arXiv preprint arXiv:2505.23735, 2025a","venue":null,"work_id":"88ad83a5-1a41-49a6-a975-2d9374634987","year":2025},"citing_paper":{"arxiv_id":"2607.00368","last_updated":"2026-07-01T03:07:17Z","snapshot_observed_at":"2026-08-06T11:17:09.298741Z","submitted_at":"2026-07-01T03:07:17Z","title":"Beyond Perplexity: A Behavioral Evaluation Framework for Deployment-Memory Claims in LLM Test-Time Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-02T13:44:24.020016Z"},"links":{"cited_paper":"/paper/2505.23735","citing_paper":"/paper/2607.00368"},"observation_digest":"sha256:cca51b2957c727ecaeeee3ddcb12387862e0a7877cb6664da6e0f6aac57dfb18","observation_id":"4de715e5-6bbe-4e3b-9aa6-a1f599f6a80b","resolution":{"observed_at":"2026-07-02T13:46:58.724354Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23735","snapshot_observed_at":"2026-08-01T14:02:33.967496Z","title":"doi:10.48550/arXiv.2505.23735 , urldate =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18899","last_updated":"2026-07-21T09:37:55Z","snapshot_observed_at":"2026-08-07T01:07:05.799281Z","submitted_at":"2026-07-21T09:37:55Z","title":"Black-Mamba: Biologically-Inspired Leaky Accumulation for Conceptual Knowledge under Distribution Drift","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-01T14:02:33.967496Z"},"links":{"cited_paper":"/paper/2505.23735","citing_paper":"/paper/2607.18899"},"observation_digest":"sha256:fc8b22918cb955e4a3a2446e962a12f91cbc5c3c82f31992ba9bb6723145555f","observation_id":"3ca04100-6fb7-408f-ace7-23151fb44e94","resolution":{"observed_at":"2026-08-01T14:02:33.967496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23735","snapshot_observed_at":"2026-08-01T09:25:22.804234Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20792","last_updated":"2026-07-22T23:34:56Z","snapshot_observed_at":"2026-08-03T08:26:10.984255Z","submitted_at":"2026-07-22T23:34:56Z","title":"Memoir: Should a Model Write to Its Memory While It Thinks?","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-01T09:25:22.804234Z"},"links":{"cited_paper":"/paper/2505.23735","citing_paper":"/paper/2607.20792"},"observation_digest":"sha256:73c70d4a07287bbbec2e671350eba604600459015e9d7016a88151bacfd2f5eb","observation_id":"95c165b9-5fa4-4c95-94d3-e8bb32be50bf","resolution":{"observed_at":"2026-08-01T09:25:22.804234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23735/citation-record","integrity":"/paper/2505.23735/integrity","json":"/paper/2505.23735/citation-record.json","paper":"/paper/2505.23735"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:44:16.284571Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:16.284571Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:78c4fe093836fddd8b524b30bf9946eef0a59828f4da3d22d4c69bb4fa65e7c9","observation_id":"e93043e2-777d-4da2-b2b4-dc5933cd653c","resolution":{"observed_at":"2026-08-07T12:44:16.284571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:16.359487Z","title":"Physics of Language Models: Part 4.1, Architecture Design and the Magic of Canon Layers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:16.359487Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:57d174e284a82a428ea07fa1db5df4d5f5d30312a5d0ea254ccf5f2a157e52c2","observation_id":"764eca94-6fe7-44b2-9eea-4e3077db5f8e","resolution":{"observed_at":"2026-08-07T12:44:16.359487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04927","last_updated":"2023-12-08T09:44:25Z","snapshot_observed_at":"2026-08-05T07:11:50.808005Z","submitted_at":"2023-12-08T09:44:25Z","title":"Zoology: Measuring and Improving Recall in Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04927","snapshot_observed_at":"2026-08-07T12:44:16.437277Z","title":"Zoology: Measuring and improving recall in efficient language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:16.437277Z"},"links":{"cited_paper":"/paper/2312.04927","citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:32acec00d5cad63f852977650709a5c053037abc7b032ff82371a25a5bae7310","observation_id":"d4b5616d-a55b-403c-b951-f6803d5e1e81","resolution":{"observed_at":"2026-08-07T12:44:16.437277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:16.553961Z","title":"Simple linear attention language models balance the recall-throughput tradeoff","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:16.553961Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:77728aec486cf3c1075bcdfa90ad59237761c2fe9c980f337004e0e10d1e7851","observation_id":"3cc17647-feee-4097-a45c-71a57a2a11c1","resolution":{"observed_at":"2026-08-07T12:44:16.553961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09433","last_updated":"2025-03-07T17:33:50Z","snapshot_observed_at":"2026-08-06T01:09:40.526196Z","submitted_at":"2023-04-19T06:00:26Z","title":"Language Models Enable Simple Systems for Generating Structured Views of Heterogeneous Data Lakes","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09433","snapshot_observed_at":"2026-08-07T12:44:16.643683Z","title":"Language models enable simple systems for generating structured views of heterogeneous data lakes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:16.643683Z"},"links":{"cited_paper":"/paper/2304.09433","citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:6e5ea353f7a8cbe3387bd671c064272ddffcc00febb4559dff281b19927b9063","observation_id":"68025587-dae6-4a25-bfd0-eec8967af5cc","resolution":{"observed_at":"2026-08-07T12:44:16.643683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.0473","last_updated":"2016-05-19T21:53:22Z","snapshot_observed_at":"2026-07-06T03:53:10.336430Z","submitted_at":"2014-09-01T16:33:02Z","title":"Neural Machine Translation by Jointly Learning to Align and Translate","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.0473","snapshot_observed_at":"2026-08-07T12:44:16.742040Z","title":"Neural machine translation by jointly learning to align and translate","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:16.742040Z"},"links":{"cited_paper":"/paper/1409.0473","citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:0a84437ee02528aa75e04d0f44df6e0d532a23d05bc5ebddfed5d5852261f0a7","observation_id":"6b90bace-42ed-411e-927f-b18eb84d832c","resolution":{"observed_at":"2026-08-07T12:44:16.742040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"pii/0885064","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:23.843337Z","title":"On the capabilities of multilayer perceptrons","venue":null,"work_id":"b4a73688-2415-4784-8a66-3f6810f5b0ec","year":1988},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:16.824485Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:93775a879483519f670d884114fbfd2fa11ba73b7c94deecd43ade37a6280046","observation_id":"1dbcbc77-0595-4ea0-83ac-08da5d80450b","resolution":{"observed_at":"2026-08-07T12:44:23.900968Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13173","last_updated":"2025-04-17T17:59:33Z","snapshot_observed_at":"2026-08-07T16:01:21.030997Z","submitted_at":"2025-04-17T17:59:33Z","title":"It's All Connected: A Journey Through Test-Time Memorization, Attentional Bias, Retention, and Online Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13173","snapshot_observed_at":"2026-08-07T12:44:16.904838Z","title":"It’s All Connected: A Journey Through Test-Time Memorization, Attentional Bias, Retention, and Online Optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:16.904838Z"},"links":{"cited_paper":"/paper/2504.13173","citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:894de90f2b51be78bec6ab6ab57fb8df48c18708fbc5c5ca4f1c890e5bad2793","observation_id":"a43f832e-4b20-419b-8017-d721daa1d409","resolution":{"observed_at":"2026-08-07T12:44:16.904838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00663","last_updated":"2024-12-31T22:32:03Z","snapshot_observed_at":"2026-08-07T09:00:33.558814Z","submitted_at":"2024-12-31T22:32:03Z","title":"Titans: Learning to Memorize at Test Time","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00663","snapshot_observed_at":"2026-08-07T12:44:17.006781Z","title":"Titans: Learning to memorize at test time","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.006781Z"},"links":{"cited_paper":"/paper/2501.00663","citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:83bb1c9ebaf2d9a4d50fdb16cbf03f32b338b4a74fed8fc37ac4a189bba97741","observation_id":"82fd8be3-e8d8-44d4-898e-8719582a8c23","resolution":{"observed_at":"2026-08-07T12:44:17.006781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:17.055155Z","title":"Low-rank bottleneck in multi-head attention models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.055155Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:3d7cd3d91db71386acfe58c6cbee1759fc9b0a6e2582b6e619a1737889605017","observation_id":"2fc41f3a-7936-4b35-8a07-1b9eedc8bc57","resolution":{"observed_at":"2026-08-07T12:44:17.055155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:17.117519Z","title":"Birth of a transformer: A memory viewpoint","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.117519Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:9dd0ca5dc78f03f276e38b1eee14f830d3e60e568445b3c5df8937ac28a424d6","observation_id":"20119822-ee70-42c5-b5c6-a5399d0392a1","resolution":{"observed_at":"2026-08-07T12:44:17.117519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:17.152416Z","title":"Piqa: Reasoning about physical commonsense in natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.152416Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:0fb8dec6c6c31b30dfe8699814ab06ad23d20d3037cf9d6a74e4044e17c652a3","observation_id":"2897e25a-aa78-48b4-a69b-d66969e23613","resolution":{"observed_at":"2026-08-07T12:44:17.152416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:17.244757Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.244757Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:aee0069cf742aebccf11b5f265d8e9bac9ca7afa8028febc5a27c320920b9a19","observation_id":"ac5a0660-e9f6-4f5b-81d3-0e9d08d6db5c","resolution":{"observed_at":"2026-08-07T12:44:17.244757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T12:44:17.313969Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.313969Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:3ce2a6bc62a7cdb219507e8e78225047d39bf2db4aeb4883d7932009bc827b2a","observation_id":"668a9529-3a44-4e85-bd5c-695886be746f","resolution":{"observed_at":"2026-08-07T12:44:17.313969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/pgec","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:23.601799Z","title":"Geometrical and Statistical Properties of Systems of Linear Inequalities with Applications in Pattern Recognition","venue":null,"work_id":"d054bcc9-7bf8-46b2-90aa-393a182c0113","year":1965},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.383499Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:f6c75212cc063adeb1917cc0a0f8ba7c4dc6ec7808fcc35d1b49006dd982f111","observation_id":"e4ec8455-943b-4016-9a31-e34c9ebf069a","resolution":{"observed_at":"2026-08-07T12:44:23.643785Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:17.426801Z","title":"Recurrent Neural Networks Learn to Store and Generate Sequences using Non-Linear Representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.426801Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:d194b09f4251973c345e52de041100e97c8a8483f43af93c56d2284da6e1ee6b","observation_id":"40965cb2-7fc2-4b3d-9f57-f0a21ebdee0a","resolution":{"observed_at":"2026-08-07T12:44:17.426801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05298","last_updated":"2025-04-07T17:56:31Z","snapshot_observed_at":"2026-08-07T16:07:51.376018Z","submitted_at":"2025-04-07T17:56:31Z","title":"One-Minute Video Generation with Test-Time Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05298","snapshot_observed_at":"2026-08-07T12:44:17.504063Z","title":"One-Minute Video Generation with Test-Time Training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.504063Z"},"links":{"cited_paper":"/paper/2504.05298","citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:89bbcd8e094b7ede03762517d5d6c074d867f9b3d06bf4ba344413e29fd18c6f","observation_id":"1b5b940b-226f-41cf-906a-287e62745e47","resolution":{"observed_at":"2026-08-07T12:44:17.504063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.00161","last_updated":"2019-04-16T21:22:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-03-01T05:32:01Z","title":"DROP: A Reading Comprehension Benchmark Requiring Discrete Reasoning Over Paragraphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.00161","snapshot_observed_at":"2026-08-07T12:44:17.567195Z","title":"DROP: A reading comprehension benchmark requiring discrete reasoning over paragraphs","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.567195Z"},"links":{"cited_paper":"/paper/1903.00161","citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:aaf35fa24fc5fcc1b3fc0aeaedae459c602f186f2c68aa9e1e7c9d987be0e27f","observation_id":"99d1fc54-21c3-4ff0-95cc-dd031fa6a69e","resolution":{"observed_at":"2026-08-07T12:44:17.567195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:17.636752Z","title":"Local polynomial modelling and its applications: monographs on statistics and applied probability 66","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.636752Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:c8345d2f3ce463ae3c5eb683cb6928a505fc3699330b55257868c5813f127f80","observation_id":"12f39fef-2f66-46e0-8d60-94e58761bd1b","resolution":{"observed_at":"2026-08-07T12:44:17.636752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:17.684164Z","title":"Towards scalable and stable paralleliza- tion of nonlinear rnns","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.684164Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:7b866d317d11b00b2abe4492a6789391156a9cae5aaff36dcf929189af7039d9","observation_id":"6e5852c3-c194-4cd0-b8ad-3d20268f8375","resolution":{"observed_at":"2026-08-07T12:44:17.684164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:17.766751Z","title":"Liquid Structural State-Space Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.766751Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:7e502db0d857a1b58989ff99a0c21fd2ffb5aae4465c75304c75fbf47d923acc","observation_id":"524e251d-7c6c-4168-a79c-d42ae1542b73","resolution":{"observed_at":"2026-08-07T12:44:17.766751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13449","last_updated":"2024-02-21T01:00:17Z","snapshot_observed_at":"2026-07-06T17:33:08.817655Z","submitted_at":"2024-02-21T01:00:17Z","title":"CAMELoT: Towards Large Language Models with Training-Free Consolidated Associative Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13449","snapshot_observed_at":"2026-08-07T12:44:17.822369Z","title":"CAMELoT: Towards Large Language Models with Training-Free Consolidated Associative Memory","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.822369Z"},"links":{"cited_paper":"/paper/2402.13449","citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:4c3dc44cc3a2796d7a930ef1425f5c24b488f91e87f6a1d33b56e45eca8c858c","observation_id":"7081f72f-6da4-4bdb-824c-7d48c125f266","resolution":{"observed_at":"2026-08-07T12:44:17.822369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:17.917477Z","title":"The organization of behavior: A neuropsychological theory","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.917477Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:ba2cf5e265f61a149b1a476502e24124bf090676d4649be7bf8edc08038161e5","observation_id":"46335500-f60d-42b6-b155-b0089cdddc03","resolution":{"observed_at":"2026-08-07T12:44:17.917477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-07T12:44:17.984327Z","title":"Gaussian error linear units (gelus)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.984327Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:64d850db44784db85df19463035b7db98a49d538745c93249a05de0290d3979e","observation_id":"0f750fee-84bb-43d1-af16-59dc769160c4","resolution":{"observed_at":"2026-08-07T12:44:17.984327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:18.085675Z","title":"Neural networks and physical systems with emergent collective computational abilities","venue":null,"work_id":null,"year":1982},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:18.085675Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:fe40e400db963ab8423f3281b65e69277992ac0cb78d9d86714ff14268deec58","observation_id":"28978044-227a-4024-8128-3b20dc54c6a7","resolution":{"observed_at":"2026-08-07T12:44:18.085675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:18.162183Z","title":"RULER: What’s the Real Context Size of Your Long-Context Language Models?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:18.162183Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:9f805ff8fe6aefd822d52b3987d15413d41e1fa47b9f6594f5b8490cccaeb32d","observation_id":"4ea50250-8084-4bd3-b683-4f8d306cdd46","resolution":{"observed_at":"2026-08-07T12:44:18.162183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23126","last_updated":"2024-10-31T16:02:34Z","snapshot_observed_at":"2026-07-06T19:42:21.306600Z","submitted_at":"2024-10-30T15:35:51Z","title":"Provably Optimal Memory Capacity for Modern Hopfield Models: Transformer-Compatible Dense Associative Memories as Spherical Codes","version":2},"cited_work":{"arxiv_id":"2410.23126","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.23126","snapshot_observed_at":"2026-08-07T12:44:23.442248Z","title":"Provably Optimal Memory Capacity for Modern Hopfield Models: Transformer-Compatible Dense Associative Memories as Spherical Codes","venue":"stat.ML","work_id":"8948026b-f8b2-4ab5-9cb1-87334216a2bd","year":2024},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:18.256869Z"},"links":{"cited_paper":"/paper/2410.23126","citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:6c1ef93de70dd0fd1f3f1caacc843380c0d086dda4ade0a87ac5215838b241a3","observation_id":"7845d763-44d0-481a-97aa-0072229a5f4b","resolution":{"observed_at":"2026-08-07T12:44:23.465951Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:18.322999Z","title":"Transformer quality in linear time","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:18.322999Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:763ec51859222eb31f6c084374e40ea955726a9af787ec582d786a89b2335f66","observation_id":"739b6c50-a19b-4ec5-ab0a-d80019037671","resolution":{"observed_at":"2026-08-07T12:44:18.322999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2003.80940","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:23.320679Z","title":"Learning capability and storage capacity of two-hidden-layer feedforward networks","venue":null,"work_id":"40f34170-a9e5-4974-8fe4-6e486f25b94b","year":2003},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:18.426121Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:6b6d2656f982ba8acf912736dcea04f62352dd2b7d5156a7cc8738a0f8b4fef7","observation_id":"ee76174c-cceb-47e4-94fb-26adcc39d5a3","resolution":{"observed_at":"2026-08-07T12:44:23.369034Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:18.463287Z","title":"Going beyond linear transformers with recurrent fast weight programmers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:18.463287Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:ad5b7e9bb49dbd9be9518c406521c0a32d848375a32ab25d74802367f8597c18","observation_id":"793c3aa9-8277-4f16-a887-b3bbd0ec1a74","resolution":{"observed_at":"2026-08-07T12:44:18.463287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:18.540822Z","title":"Muon: An optimizer for hidden layers in neural networks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:18.540822Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:e4fd38077859420abecee507b72445372038f04967197398e9ebaa9f53ce145a","observation_id":"d9f982d1-524e-4ef8-ab1c-8931065d1d40","resolution":{"observed_at":"2026-08-07T12:44:18.540822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:18.587739Z","title":"PolySketchFormer: Fast Transformers via Sketching Polyno- mial Kernels","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:18.587739Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:704ed8707ef8db267928db9f8492322eb295af1d830aa8fc5780d3abae196b11","observation_id":"8fa0788f-2e73-49d0-ae33-80eddcaae43b","resolution":{"observed_at":"2026-08-07T12:44:18.587739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:18.672303Z","title":"PolySketchFormer: Fast Transformers via Sketching Polyno- mial Kernels","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:18.672303Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:d33befad181353c0744e82d97bc37e947c534c8ec8c2faf40e7a4a37f1f5a504","observation_id":"c5cb2e5a-5860-4e26-a0b4-a57b615a3ee6","resolution":{"observed_at":"2026-08-07T12:44:18.672303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-07T12:44:18.742397Z","title":"Gemma 3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:18.742397Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:107512f1669fe55ced6272802070d61af71dd550a98eeb420dea98beb3d7a9c7","observation_id":"c826f42f-2089-4fef-a18e-40fb39da9941","resolution":{"observed_at":"2026-08-07T12:44:18.742397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:27.656175Z","title":"Karami and V","venue":null,"work_id":"83177b67-ac7d-4d99-b8a9-b06499a89591","year":2025},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:18.829227Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:770748c6bf59cbed32096fea74e3cc6d9ed32e2a9aeb0d5b061457ad99497810","observation_id":"7d91f95f-bc61-4607-8621-7e75060c3b99","resolution":{"observed_at":"2026-08-07T12:44:27.715760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:18.891302Z","title":"Finetuning Pretrained Transformers into RNNs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:18.891302Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:3874ac321b2a7488659dadf0176c21699ccec6c10df70d725731ee667ae5897c","observation_id":"8d8a731a-8e09-42a9-a0a3-1003d802ba7d","resolution":{"observed_at":"2026-08-07T12:44:18.891302Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:18.953666Z","title":"Transformers are rnns: Fast au- toregressive transformers with linear attention","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:18.953666Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:aa039cbd227c8a92f211f62ce00c2a48dd7244cf086645aaa1002420efa7c0a1","observation_id":"23391a9d-e69b-449e-921f-cd34c2e5537d","resolution":{"observed_at":"2026-08-07T12:44:18.953666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:27.407957Z","title":"Are you smarter than a sixth grader? textbook question answering for multimodal machine comprehension","venue":null,"work_id":"28462696-a183-4f32-93ee-cc20785dd7d6","year":2017},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:18.987639Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:7e1dc31026b2feb8802df44dcada1b6bbbef703a05977f45a2f8c797753bd262","observation_id":"aa3c12a7-8413-4cd5-907f-f3883409c2ec","resolution":{"observed_at":"2026-08-07T12:44:27.526884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06446","last_updated":"2021-07-14T01:38:40Z","snapshot_observed_at":"2026-07-06T11:28:53.825631Z","submitted_at":"2021-07-14T01:38:40Z","title":"Hierarchical Associative Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06446","snapshot_observed_at":"2026-08-07T12:44:19.057671Z","title":"Hierarchical associative memory","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:19.057671Z"},"links":{"cited_paper":"/paper/2107.06446","citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:b5c999149f0804eae1e50f0911eeb7211f5aec8c17f6502585569f799e46837e","observation_id":"4081d646-69d8-4d30-a368-29927fabab8a","resolution":{"observed_at":"2026-08-07T12:44:19.057671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:27.176820Z","title":"Dense associative memory for pattern recognition","venue":null,"work_id":"607e1664-b3c1-44be-bdbe-b03a6c9fe426","year":2016},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:19.129700Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:908229f299971295058e477e64a675741e3a4a86539b4cae6539ad9e1f629ead","observation_id":"d6792b17-e197-4d8d-a6df-7246a1a5f68f","resolution":{"observed_at":"2026-08-07T12:44:27.285468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:27.024160Z","title":"BABILong: Testing the Limits of LLMs with Long Context Reasoning-in-a-Haystack","venue":null,"work_id":"25dbac04-1f89-45df-9df6-6a22b1f3c4d9","year":2024},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:19.171684Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:d451e09c5d5a8afb05809f8ebf6b61688ef7092b9cf6c26860ff232d4f837591","observation_id":"64f56b0d-0c45-43b1-8d7b-159e1968078a","resolution":{"observed_at":"2026-08-07T12:44:27.071658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:26.769562Z","title":"Natural questions: a benchmark for question answering research","venue":null,"work_id":"274243d5-aa2b-4035-8306-e2a29d44241c","year":2019},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:19.226676Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:53291eb949a065381a32e06f9779a8cbeaddb1290b4d0ee8d18f00d7b2805632","observation_id":"133c760c-983d-4277-bcd8-9feeefb73aeb","resolution":{"observed_at":"2026-08-07T12:44:26.865536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16407","last_updated":"2024-03-25T03:47:53Z","snapshot_observed_at":"2026-07-06T17:49:52.751335Z","submitted_at":"2024-03-25T03:47:53Z","title":"A Survey on Long Video Generation: Challenges, Methods, and Prospects","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16407","snapshot_observed_at":"2026-08-07T12:44:19.256003Z","title":"A survey on long video generation: Challenges, methods, and prospects","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:19.256003Z"},"links":{"cited_paper":"/paper/2403.16407","citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:e1da04dd06ffde31f2b2779352b3255767b2996835fe1c7efd2e5b0f9165d538","observation_id":"d0286e43-f346-4113-ae7b-c0b2251fa678","resolution":{"observed_at":"2026-08-07T12:44:19.256003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2412.05562","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:23.066527Z","title":"On the expressive power of modern hopfield networks","venue":null,"work_id":"82532027-d777-4b7e-8b8c-a4e8e6e0f8b7","year":2024},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:19.313998Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:620e98d3fa5d661c66f03913efbbf8c884dde447ad485fac117f43bfe94fe4ea","observation_id":"2b1742e4-6a6a-4b1d-8d07-001280a2a3ca","resolution":{"observed_at":"2026-08-07T12:44:23.136849Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:26.554076Z","title":"Parallelizing non-linear sequential models over the sequence length","venue":null,"work_id":"8f865aa8-ee94-42b6-a0b8-edcae5f72d1b","year":2024},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:19.356471Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:e16531ff4d7e6659049338d8b8211d6ea3a13d4a5f8495d1c45059b744962926","observation_id":"0ac28b72-2457-4be5-a606-a2f1ef9ea984","resolution":{"observed_at":"2026-08-07T12:44:26.653974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14207","last_updated":"2024-10-02T14:32:59Z","snapshot_observed_at":"2026-08-04T14:58:56.675148Z","submitted_at":"2024-07-19T11:12:08Z","title":"Longhorn: State Space Models are Amortized Online Learners","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14207","snapshot_observed_at":"2026-08-07T12:44:19.453499Z","title":"Longhorn: State space models are amortized online learners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:19.453499Z"},"links":{"cited_paper":"/paper/2407.14207","citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:e84e3df89782bf63e9be0e7648201b36946d6a8f9c9c34d16cfbbfe79719c085","observation_id":"05c998bb-ed52-4e59-a899-a7ab0f404288","resolution":{"observed_at":"2026-08-07T12:44:19.453499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:19.519237Z","title":"Lost in the middle: How language models use long contexts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:19.519237Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:aa6ed1d6ef06b79135df076dcb8aa232c032e2294b48fbb08019f17c8c44348e","observation_id":"733a6fbf-dee4-45b7-9d0f-322e9e3efc70","resolution":{"observed_at":"2026-08-07T12:44:19.519237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:26.417280Z","title":"Openceres: When open information extraction meets the semi-structured web","venue":null,"work_id":"f96ad6b6-e56d-4745-a0da-a5e9ccce4862","year":2019},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:19.568056Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:7c5b246ce6e865390a67538aa41bc07b9d4a16617bc4771d54163e3750db83ce","observation_id":"6fa6e836-163a-4c86-b42c-e3317fc857b2","resolution":{"observed_at":"2026-08-07T12:44:26.478808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:26.282865Z","title":"Exponential capacity of dense associative memories","venue":null,"work_id":"878e7c1d-728f-44fd-bcc0-bca79141bc4a","year":2024},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:19.601270Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:870cdd5fe667493110f2d9afe79a5dccd28e4f53cba6e6cc86c1025c04c5dbfa","observation_id":"c7d34e3f-c0b9-4043-bbdf-0ee69f93a960","resolution":{"observed_at":"2026-08-07T12:44:26.310069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:19.669876Z","title":"Pointer Sentinel Mixture Models","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:19.669876Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:55afac022dbd81db4cdd6f4351cacfbd1d7f4c672807763f7094cd92abdf7f9d","observation_id":"4b532e65-6401-4aed-bbb7-1407280480b7","resolution":{"observed_at":"2026-08-07T12:44:19.669876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:26.128502Z","title":"The Illusion of State in State-Space Models","venue":null,"work_id":"264a05e2-b374-40c1-a7ff-747613f90754","year":2024},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:19.715469Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:3976fd2c3c0f8f5209742d335d61145bc864dfed3bff9bbcf7126405323e4156","observation_id":"5f9f0d12-02ac-4fed-9332-08789133d1da","resolution":{"observed_at":"2026-08-07T12:44:26.179723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:26.024298Z","title":"On the number of linear regions of deep neural networks","venue":null,"work_id":"c94f1a2c-a3b9-4f46-9e07-1a29e8e95bfb","year":2014},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:19.776045Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:7f3e156ca2e67fc69869ccd48aef373789c52e5a884e2b77f44a2933196a20aa","observation_id":"b5f8f91a-b17d-4a34-a3bf-a631215c4aa7","resolution":{"observed_at":"2026-08-07T12:44:26.074333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:19.812862Z","title":"Metalearned neural memory","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:19.812862Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:4e0293d8eeea0b404b774e2e1b416f9b6649626ea3bcd8a480c7d049c4455cc1","observation_id":"91245960-6a1f-4453-9f1c-11d7521d6d0a","resolution":{"observed_at":"2026-08-07T12:44:19.812862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:25.919382Z","title":"Neural semantic encoders","venue":null,"work_id":"146587d6-562c-4723-aff6-0d817375db4d","year":2017},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:19.847621Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:f6fc9eaa7295fc2d4ff920d6c3d02f7776cd35ffecd287580f8497f1423bac7b","observation_id":"946ce6eb-a336-4616-9864-4809bfcd7af4","resolution":{"observed_at":"2026-08-07T12:44:25.953063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:19.889853Z","title":"The LAMBADA dataset: Word prediction requiring a broad discourse context","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:19.889853Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:bacc53b2678fc6bb3b9849f57ed439b557a162c1c817aea060fd621f0ec52936","observation_id":"5f0170e4-8f0b-411b-b1f9-ce2b259bc9b4","resolution":{"observed_at":"2026-08-07T12:44:19.889853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6098","last_updated":"2014-02-14T17:52:12Z","snapshot_observed_at":"2026-08-08T21:37:33.532853Z","submitted_at":"2013-12-20T20:22:31Z","title":"On the number of response regions of deep feed forward networks with piece-wise linear activations","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6098","snapshot_observed_at":"2026-08-07T12:44:19.929432Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:19.929432Z"},"links":{"cited_paper":"/paper/1312.6098","citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:d3b45be2473c6905cb8c3859d140828d3969fc38a70a1cd7d15bfbf6195e21b0","observation_id":"d2fe2ee8-e9c7-4042-bb9a-7e587d61e46e","resolution":{"observed_at":"2026-08-07T12:44:19.929432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:25.799546Z","title":"The fineweb datasets: Decanting the web for the finest text data at scale","venue":null,"work_id":"f5a73e02-b2e6-429e-a573-e8641638b5e1","year":2024},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:19.988147Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:8a3752769dcf0a39afa20b0cff1a4ab5ecd6c8ac933e67fed2133e89002f3157","observation_id":"5e0cdc5a-3643-4495-aa2a-fa7d9dc30b80","resolution":{"observed_at":"2026-08-07T12:44:25.853611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:25.661651Z","title":"RWKV: Reinventing RNNs for the Transformer Era","venue":null,"work_id":"d8afa982-1d3b-485f-95d4-72564a10b8c9","year":2023},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:20.016768Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:6aa8c8f5af8b60f8f7df6d24aa458f736ac19a705b1311dcf1c35eaac1f294fe","observation_id":"974dc176-ce33-47c1-ad83-b154d7032256","resolution":{"observed_at":"2026-08-07T12:44:25.724072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05892","last_updated":"2024-09-26T22:39:08Z","snapshot_observed_at":"2026-08-06T19:53:21.536135Z","submitted_at":"2024-04-08T22:20:59Z","title":"Eagle and Finch: RWKV with Matrix-Valued States and Dynamic Recurrence","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05892","snapshot_observed_at":"2026-08-07T12:44:20.061247Z","title":"Eagle and finch: Rwkv with matrix-valued states and dynamic recurrence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:20.061247Z"},"links":{"cited_paper":"/paper/2404.05892","citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:d4a9583382a0ada240a142c146b8922320b840afdef5e3b875089a7d8f1c1cbf","observation_id":"587451e4-bf4c-4904-8f24-b5dbaf727e39","resolution":{"observed_at":"2026-08-07T12:44:20.061247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14456","last_updated":"2025-03-30T13:46:44Z","snapshot_observed_at":"2026-08-07T16:54:15.957609Z","submitted_at":"2025-03-18T17:31:05Z","title":"RWKV-7 \"Goose\" with Expressive Dynamic State Evolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14456","snapshot_observed_at":"2026-08-07T12:44:20.131118Z","title":"Rwkv-7\" goose","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:20.131118Z"},"links":{"cited_paper":"/paper/2503.14456","citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:7faeb404d626ae0ef45ff0517896ff6728d9bcdb3f6413ae39b8f6dc0bfe3525","observation_id":"c99c4a40-abb0-4a5b-85b8-9531e0d73adb","resolution":{"observed_at":"2026-08-07T12:44:20.131118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17844","last_updated":"2024-08-19T17:26:18Z","snapshot_observed_at":"2026-07-06T17:51:24.261505Z","submitted_at":"2024-03-26T16:33:12Z","title":"Mechanistic Design and Scaling of Hybrid Architectures","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17844","snapshot_observed_at":"2026-08-07T12:44:20.173527Z","title":"Mechanistic design and scaling of hybrid architectures","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:20.173527Z"},"links":{"cited_paper":"/paper/2403.17844","citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:f8cbd68db97aa08f6541da35045a30a8144ddb7627c5c180975ccf810f9d1646","observation_id":"a74b312b-ed80-467d-89fe-9b54d11ce7f4","resolution":{"observed_at":"2026-08-07T12:44:20.173527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:20.211189Z","title":"Neural network capacity using delta rule","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:20.211189Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:072f59e27a04061a83abb3835a196f3f786199c818752a7e3f1c11266e082810","observation_id":"f4e36aea-7c8a-4f12-a9e4-b3dd25d0d819","resolution":{"observed_at":"2026-08-07T12:44:20.211189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.05250","last_updated":"2016-10-11T02:42:36Z","snapshot_observed_at":"2026-08-08T11:05:45.903773Z","submitted_at":"2016-06-16T16:36:00Z","title":"SQuAD: 100,000+ Questions for Machine Comprehension of Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.05250","snapshot_observed_at":"2026-08-07T12:44:20.272009Z","title":"Squad: 100,000+ questions for machine comprehension of text","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:20.272009Z"},"links":{"cited_paper":"/paper/1606.05250","citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:a8437c8376a92d154228e03d5504b17d2d7e377b4795a84283c06f35215d0b11","observation_id":"4e8ec45d-f332-48d7-8ecb-2ddd75252ab7","resolution":{"observed_at":"2026-08-07T12:44:20.272009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:25.517029Z","title":"Hopfield Networks is All You Need","venue":null,"work_id":"6be7918b-6095-4ae5-bb8e-74e311db8b15","year":2021},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:20.377975Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:5da3c2c520c72e4526a90623472eca22e90de3c5044eb610bc61dde15759d1d6","observation_id":"77532529-3e2a-46e7-8457-a48f3f4d420a","resolution":{"observed_at":"2026-08-07T12:44:25.581649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07522","last_updated":"2025-02-28T02:20:49Z","snapshot_observed_at":"2026-08-06T19:04:16.718797Z","submitted_at":"2024-06-11T17:50:51Z","title":"Samba: Simple Hybrid State Space Models for Efficient Unlimited Context Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07522","snapshot_observed_at":"2026-08-07T12:44:20.430533Z","title":"Samba: Simple Hybrid State Space Models for Efficient Unlimited Context Language Modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:20.430533Z"},"links":{"cited_paper":"/paper/2406.07522","citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:ac3fbe6206c4ac537c1fbe5d16486222fd16ec95ff04506202bacd0cd092db0c","observation_id":"d8217d6e-6a6e-4252-8ef6-aa80903612cd","resolution":{"observed_at":"2026-08-07T12:44:20.430533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:20.493286Z","title":"Winogrande: An adversarial winograd schema challenge at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:20.493286Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:6b2b3e836252e8cdc716c9691c947c31763b31d0bfdd391b31e16b3912b1600b","observation_id":"4b46b00c-896d-4170-a50d-ac0eb27a2f5c","resolution":{"observed_at":"2026-08-07T12:44:20.493286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:20.530569Z","title":"Social IQa: Commonsense Reasoning about Social Interactions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:20.530569Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:9cba8134364286d7366627ce808fb3834245d94cbebc3cc54d679e5ee72e363c","observation_id":"e0f0c553-4199-4444-922d-9b2cb0171f7b","resolution":{"observed_at":"2026-08-07T12:44:20.530569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:25.386160Z","title":"The dynamics of gradient descent for overparametrized neural networks","venue":null,"work_id":"9c761d23-68b8-4f74-90fa-9ad36b4b609d","year":2021},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:20.625060Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:83aa7fd164d0dd448916c16c685779a6a1e240240cb0188d16131deea39fbb49","observation_id":"97196d38-addb-4102-b3fb-c4afe3fea3d4","resolution":{"observed_at":"2026-08-07T12:44:25.438522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:20.715932Z","title":"Linear transformers are secretly fast weight programmers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:20.715932Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:6fd0e3034a64f6dcfcfb4293b8453c29b2300a54c913df2d34ac282839159cd7","observation_id":"a515b57b-a624-4168-bbdd-b65db70e3b07","resolution":{"observed_at":"2026-08-07T12:44:20.715932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:20.846440Z","title":"Learning to control fast-weight memories: An alternative to recurrent nets. Accepted for publication in","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:20.846440Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:507d5ae7371f79a5985cb737f85957a7b7560fada55fdfe1dd026d6e488a94f3","observation_id":"42d04739-edbd-4e5a-8cdd-7f71730a0d97","resolution":{"observed_at":"2026-08-07T12:44:20.846440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:20.918564Z","title":"Reducing the ratio between learning complexity and number of time varying variables in fully recurrent nets","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:20.918564Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:72eab901d9d4f81d18f1c1c16c3f4ec5cf008e00a90d17c1dd5d5a22416247b2","observation_id":"bca0de13-8979-42ba-babb-00f13ccec444","resolution":{"observed_at":"2026-08-07T12:44:20.918564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:20.959169Z","title":"Long Short-term Memory","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:20.959169Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:2b994b4d5aafd5ff233b92c663762310434a5704aa6dcc26ed4273d8371df300","observation_id":"396bfd40-031a-49c4-95f0-bbcae3bb32d5","resolution":{"observed_at":"2026-08-07T12:44:20.959169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07827","last_updated":"2025-06-12T13:21:50Z","snapshot_observed_at":"2026-08-08T14:04:24.459675Z","submitted_at":"2025-02-10T19:59:31Z","title":"Implicit Language Models are RNNs: Balancing Parallelization and Expressivity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07827","snapshot_observed_at":"2026-08-07T12:44:21.006670Z","title":"Implicit Language Models are RNNs: Balancing Parallelization and Expressivity","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:21.006670Z"},"links":{"cited_paper":"/paper/2502.07827","citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:25207f3ee90ee9f6eaffda679afc494059ca2d7c4411e713c23f6e6ca7ea11c8","observation_id":"cb60a949-6fa9-4c1a-a706-3c27e74e4216","resolution":{"observed_at":"2026-08-07T12:44:21.006670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:25.265404Z","title":"Adjustment of an inverse matrix corresponding to a change in one element of a given matrix","venue":null,"work_id":"99db4736-59f7-40a5-8d39-1b42ac0b809f","year":1950},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:21.053778Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:3bb46c176ed45920a6a7f4075eef2575cc88cab55470827e45a851c15604cfd3","observation_id":"9674b266-1441-44c7-8df8-4c3b6f29e33b","resolution":{"observed_at":"2026-08-07T12:44:25.308331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:21.099935Z","title":"DeltaProduct: Increasing the Expressivity of DeltaNet Through Products of Householders","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:21.099935Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:648fad122b172fd0d49454af8f625076ce58af45bb5ce686795dca2e41e6c17d","observation_id":"19a7f80a-5a87-4d90-bf05-f6ffab0ea947","resolution":{"observed_at":"2026-08-07T12:44:21.099935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:25.182319Z","title":"Simplified State Space Layers for Sequence Modeling","venue":null,"work_id":"21c7ed54-06bd-42c8-b198-485cbe9c111b","year":2023},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:21.296107Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:3b2e17c816e81ebde6b0ce76db5540237807db9124d4d5cae98749dcabb54ecf","observation_id":"f534dec2-59b2-4ad6-9365-424e8d16a5ff","resolution":{"observed_at":"2026-08-07T12:44:25.217819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04620","last_updated":"2025-08-31T18:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-05T16:23:20Z","title":"Learning to (Learn at Test Time): RNNs with Expressive Hidden States","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04620","snapshot_observed_at":"2026-08-07T12:44:21.337486Z","title":"Learning to (learn at test time): Rnns with expressive hidden states","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:21.337486Z"},"links":{"cited_paper":"/paper/2407.04620","citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:3622f8e431b29a92213b1c3a20e196c91b560a47315997f154347d4aa411534a","observation_id":"365dfb05-c86b-4015-b11f-8730592e98f8","resolution":{"observed_at":"2026-08-07T12:44:21.337486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-07T12:44:21.379960Z","title":"Retentive network: A successor to transformer for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:21.379960Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:d318a801141c63712adbb21fd2fa1fccaa8c2cb529beb034acd66b07909d3ed1","observation_id":"9d833f32-d747-4719-9b7f-123fe2bc36fc","resolution":{"observed_at":"2026-08-07T12:44:21.379960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:21.445209Z","title":"Learning and memory: Basic principles, processes, and procedures","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:21.445209Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:03401fdb185ece358a95fde972e72d22a7d20ecc85d2af0d4c7ffa6005a1471d","observation_id":"baeed0a2-d8f7-4810-96ed-3bad0a7f7f12","resolution":{"observed_at":"2026-08-07T12:44:21.445209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08132","last_updated":"2024-02-14T13:04:28Z","snapshot_observed_at":"2026-07-06T17:29:13.310354Z","submitted_at":"2024-02-12T23:55:55Z","title":"On the Resurgence of Recurrent Models for Long Sequences -- Survey and Research Opportunities in the Transformer Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08132","snapshot_observed_at":"2026-08-07T12:44:21.493894Z","title":"On the resurgence of recurrent models for long sequences: Survey and research opportunities in the transformer era","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:21.493894Z"},"links":{"cited_paper":"/paper/2402.08132","citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:c29e1432ba57b8508ae59f518c561a04e2d49d4bd85135018616382f38244ee4","observation_id":"14ed0c6c-f08c-4870-bdc7-f84da380ce5e","resolution":{"observed_at":"2026-08-07T12:44:21.493894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:25.045825Z","title":"Attention is All you Need","venue":null,"work_id":"c28cd9e9-d836-4efe-a3e7-747eedb05611","year":2017},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:21.551009Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:fd64a2550d3a51644cde136b968b295d38dbff8cdc9b9ff4ac04b2c462c33e95","observation_id":"f8b33804-d530-4353-bdd1-590e87cc07c8","resolution":{"observed_at":"2026-08-07T12:44:25.103904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05858","last_updated":"2024-10-15T13:43:50Z","snapshot_observed_at":"2026-07-06T16:17:11.839251Z","submitted_at":"2023-09-11T22:42:50Z","title":"Uncovering mesa-optimization algorithms in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05858","snapshot_observed_at":"2026-08-07T12:44:21.592813Z","title":"Uncovering mesa-optimization algorithms in transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:21.592813Z"},"links":{"cited_paper":"/paper/2309.05858","citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:67e7e6931a40bf71f8bf585f0d60a87cd77c1afbbab426bd36d7790ebc65230b","observation_id":"ee67979d-b995-4e61-9598-ffee220492d9","resolution":{"observed_at":"2026-08-07T12:44:21.592813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12352","last_updated":"2025-05-02T02:07:05Z","snapshot_observed_at":"2026-08-08T07:47:07.173404Z","submitted_at":"2025-01-21T18:32:31Z","title":"Test-time regression: a unifying framework for designing sequence models with associative memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12352","snapshot_observed_at":"2026-08-07T12:44:21.637138Z","title":"Test-time regression: a unifying framework for designing sequence models with associative memory","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:21.637138Z"},"links":{"cited_paper":"/paper/2501.12352","citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:0998ce512f6ad255f22073e64b5d01fffa03c85d40fe9a1614b5c7c9db7f0c1f","observation_id":"1d178049-daf8-48e6-a22e-b814077725a1","resolution":{"observed_at":"2026-08-07T12:44:21.637138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18510","last_updated":"2024-12-06T19:50:34Z","snapshot_observed_at":"2026-08-06T00:21:22.707014Z","submitted_at":"2024-02-28T17:38:06Z","title":"RNNs are not Transformers (Yet): The Key Bottleneck on In-context Retrieval","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18510","snapshot_observed_at":"2026-08-07T12:44:21.680275Z","title":"Rnns are not transformers (yet): The key bottleneck on in-context retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:21.680275Z"},"links":{"cited_paper":"/paper/2402.18510","citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:ae157cba18a8b962378204c38062545152d159bb3d9b2f6059a2feaa536c0cdc","observation_id":"15264af3-557b-4134-b0e0-a07671cd254f","resolution":{"observed_at":"2026-08-07T12:44:21.680275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:24.968607Z","title":"Adaptive switching circuits","venue":null,"work_id":"cd1e644c-1a45-4419-be7c-5ac34ee4348c","year":1988},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:21.776773Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:aff2f73ad14a72448f8bcafefc9fd678cac583ea7ece5823e1e747c9615ca76c","observation_id":"6db8b652-f0b7-4ee9-bf38-63011a2a5715","resolution":{"observed_at":"2026-08-07T12:44:25.007354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:24.898782Z","title":"Non-holographic associative memory","venue":null,"work_id":"324204b5-1830-4983-9813-3dd5125cdab6","year":1969},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:21.893375Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:e473d1a4718a19fb9582f504ebda7725c756cb0d2d485940b9e3e5d0267efabe","observation_id":"2a55f7dc-3155-492e-aa39-565dd20d6f28","resolution":{"observed_at":"2026-08-07T12:44:24.919268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06464","last_updated":"2025-03-06T06:57:34Z","snapshot_observed_at":"2026-08-03T00:27:18.402796Z","submitted_at":"2024-12-09T13:09:04Z","title":"Gated Delta Networks: Improving Mamba2 with Delta Rule","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06464","snapshot_observed_at":"2026-08-07T12:44:21.969608Z","title":"Gated Delta Networks: Improving Mamba2 with Delta Rule","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:21.969608Z"},"links":{"cited_paper":"/paper/2412.06464","citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:48aed66445ad50b03db84e4b1e38b1380792e484ed37881550c5c7f68395341d","observation_id":"d3daed30-902b-4794-be2a-b3dccf7d7a1e","resolution":{"observed_at":"2026-08-07T12:44:21.969608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:24.811478Z","title":"Gated Linear Attention Transformers with Hardware-Efficient Training","venue":null,"work_id":"0cad0710-18fd-4175-acc1-7b3e418a89e1","year":2024},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:22.006192Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:399467402cbba85b0d233199d1dc3e5737e4c799b815ebf856e2066ebb6d9673","observation_id":"5d870039-d0b8-439b-be1c-506dea357cc3","resolution":{"observed_at":"2026-08-07T12:44:24.861595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:24.754446Z","title":"Parallelizing linear transformers with the delta rule over sequence length","venue":null,"work_id":"0c775771-eadf-4645-a69b-33f331354d15","year":2024},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:22.059467Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:ef2390f00e1c82a594c6a85233c28af89defea0eabb25bc4ee644ba8bb1463b1","observation_id":"044357a8-ec67-47f6-846e-b494654f5cac","resolution":{"observed_at":"2026-08-07T12:44:24.778233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:22.122924Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:22.122924Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:3284a604be501c4222754e8f644498dcf9b1e0890d73ad1b00012214a7276509","observation_id":"2effa81f-02e4-420f-82be-61694b84a7fb","resolution":{"observed_at":"2026-08-07T12:44:22.122924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.14852","last_updated":"2024-04-01T03:51:06Z","snapshot_observed_at":"2026-08-07T22:00:06.189366Z","submitted_at":"2022-12-30T17:59:01Z","title":"An Analysis of Attention via the Lens of Exchangeability and Latent Variable Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.14852","snapshot_observed_at":"2026-08-07T12:44:22.157650Z","title":"An analysis of attention via the lens of exchangeability and latent variable models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:22.157650Z"},"links":{"cited_paper":"/paper/2212.14852","citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:a1135382689b90934a7a2bbfb2271d2f2c328f4390f9ce20062c2fda73c4245f","observation_id":"79dcd8b9-279d-4050-96f4-ef5abcf90655","resolution":{"observed_at":"2026-08-07T12:44:22.157650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:24.687655Z","title":"In the inner optimization loop, all other parameters from the model are considered hyperparameters and are fixed and not optimized","venue":null,"work_id":"df236273-73aa-49c7-9057-c8268e2dc267","year":null},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:22.189805Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:a7878e96c4b8b7786e2cd2c399d1ba6c7c95f3230338bf99bda124adbb235394","observation_id":"132f558f-4928-4074-aa66-eebf42b34df9","resolution":{"observed_at":"2026-08-07T12:44:24.714316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:24.606444Z","title":"B.1 Examples As an example, one can define the linear attention as the optimization of dot-product similarity with gradient descent: i.e., ˜ℓ𝑡 :=⟨M𝑡−1k𝑡, v𝑡⟩","venue":null,"work_id":"e062dad9-a6d4-4710-b940-d7c382495d1c","year":2021},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:22.219291Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:24902974b1ce659f711eac09b43370d25d066b15971d01a233806769ea04eb3f","observation_id":"9cf26443-72a9-490e-b70d-0d950d96d135","resolution":{"observed_at":"2026-08-07T12:44:24.643471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:24.501038Z","title":"low-rank bottleneck","venue":null,"work_id":"f0883ae1-8ee3-4b93-bc0f-3599c72bb038","year":1988},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:22.288669Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:45f1f9a3cb44bc0a3680685a15b4222c51003023229810b3147995c7e82ec412","observation_id":"b48a6b58-038f-4493-9b60-f4cbf20db67f","resolution":{"observed_at":"2026-08-07T12:44:24.530274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:24.421377Z","title":"D.4 Atlas In the Atlas, we use the same internal objective as OmegaNet but we optimize it using Muon optimizer (Jordan et al","venue":null,"work_id":"e1e77cff-6a86-4eba-9776-7c0a30fe9d7c","year":null},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:22.365133Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:d0699be0fb211e8d265fb24f20c821fcc43a3aa1b2276e1601b4bd72a9f572d9","observation_id":"53a32e66-7ba3-4441-97aa-e1abd61b05e4","resolution":{"observed_at":"2026-08-07T12:44:24.458134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:24.137305Z","title":"2025; Behrouz, Zhong, et al","venue":null,"work_id":"0bcf34d0-2a9d-4763-8113-d4454b8434d2","year":2025},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:22.521728Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:ee111fe19a30482809e3c54e1d97977825be316f5c437a2961e7f32f25c7fddd","observation_id":"b228bbde-34a0-4792-bf98-1432bc98f866","resolution":{"observed_at":"2026-08-07T12:44:24.218875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:24.045194Z","title":null,"venue":null,"work_id":"26e62225-561d-4edd-8f4a-712346e25a9e","year":2024},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:22.594242Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:036865c76697669c65f8c12a97e964d7aa5278734b83f59d0e36a188cc1e544e","observation_id":"a5c0f29f-ed0b-4b9c-b719-ddc729cd0a78","resolution":{"observed_at":"2026-08-07T12:44:24.088409Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:24.299167Z","title":"That is, M𝑡 =𝛼𝑡M𝑡−1+ Newton-schulz5(S𝑡) (57) S𝑡 =𝜃𝑡S𝑡−1− 𝑡∑︁ 𝑖=𝑡−𝑐+1 𝜂(𝑡) 𝑖 ∇∥M𝑡−1(𝜙(k𝑖))− v𝑖∥2","venue":null,"work_id":"c72c49cc-ad1a-49a8-96d2-fba99ebdb37a","year":null},"citing_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:22.464229Z"},"links":{"citing_paper":"/paper/2505.23735"},"observation_digest":"sha256:7eefb76f40e7036ba9ed754b113940a6ae9fd45a3a98f3790b5fea2628c3df66","observation_id":"161926fb-025d-4049-8c7e-2313b36ac155","resolution":{"observed_at":"2026-08-07T12:44:24.380709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T22:01:11.686885Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time"},"reference_resolution":{"displayed":98,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":64,"verified_exact":3,"verified_fuzzy":28},"total_outbound_references":98},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 98 of 98 outbound references and 26 inbound Pith citation observations for arXiv:2505.23735."}